GPT
F

FuseO1-DeepSeekR1-QwQ-SkyT1-32B-Preview

קוד פתוח

FuseAIapache-2.02025-01-20

  • safetensors
  • qwen2

שילוב משקלים ישיר בין שלושה מודלי חשיבה של 32B מייצר ביצועים מתמטיים גבוהים בלי לאמן מחדש. אם אתם צריכים פתרון בעיות עמוק בקוד פתוח, זו נקודת פתיחה חזקה.

  • 33Bפרמטרים
  • 131,072טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 143הורדות בחודש

מה זה

הפרויקט הזה מבוסס על טכניקת מיזוג משקלים בשם SCE שלקחה שלושה מודלים קיימים בגודל 32 מיליארד פרמטרים, DeepSeek R1 Distill Qwen, QwQ Preview ו Sky T1, ואיחדה אותם למודל אחד. המטרה כאן היא לחבר יכולות חשיבה ארוכות של System 2 בלי לשלם על אימון מלא מאפס.

במבחנים שפורסמו הוא מציג שיפור עקבי מול כל אחד משלושת מודלי המקור שלו. במבחן AIME24 הוא מגיע לדיוק של 74.0 ב Pass@1, שזה גבוה מ OpenAI o1-mini שמקבל 63.6 וקרוב יחסית ל OpenAI o1 המלא שעומד על 79.2. במבחני קוד כמו LiveCodeBench הוא מגיע ל 57.9 לעומת 56.1 של הזיכוך של DeepSeek. בפועל, החיבור בין המשקלים עובד ולא שבר את יכולת ההסקה, אלא חיזק את היציבות בפתרון בעיות מתמטיקה ומדע מורכבות.

מתאים ל

  • פתרון בעיות מתמטיקה

    מגיע ל 74.0 ב AIME24 בזכות שילוב תהליכי הסקה ארוכים משלושה מודלים שונים.

  • מענה לשאלות מדעיות

    מציג 62.1 במבחן GPQA Diamond ומספק הסברים מנומקים צעד אחר צעד לבעיות מורכבות.

  • ניתוח לוגיקה באלגוריתמים

    עובר את רף 57 נקודות ב LiveCodeBench ומתאים לבדיקת נכונות של קוד אלגוריתמי.

איפה זה נופל

זהו מיזוג נסיוני שמוגדר כגרסת Preview, ובכרטיס המודל יש אזהרה טכנית קריטית: חייבים להגדיר ידנית add_bos_token לערך false בהגדרות הטוקנייזר כדי למנוע הכפלה של טוקן הפתיחה בכל שאילתה. מי שיפספס את זה יקבל ירידה חדה באיכות התשובות.

בנוסף, המודל דורש תבנית פרומפט נוקשה עם תגיות מיוחדות לתהליך החשיבה, ולא מציג שיפור דרמטי במשימות קוד קשות, שם הוא עומד על 25.5 בלבד ב LiveCodeBench Hard. לא מדובר במודל שיחה כללי, ואם תנסו להשתמש בו לצ'אט רגיל או לטקסט קצר הוא יבזבז המון טוקנים וזמן על חשיבה מיותרת.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

הכרטיס לא מציין אימון ייעודי בעברית או מבחני שפה מקומיים. המודלים שמהם הוא מורכב מבוססים על Qwen שמכיר עברית ברמה בסיסית עד בינונית, אבל כל תהליך החשיבה והמבחנים כאן נבנו על אנגלית, מתמטיקה וקוד.

למה להשתמש בו במקום במודל המקורי של DeepSeek?

במבחני ההסקה הקשים הוא עוקף את DeepSeek-R1-Distill-Qwen-32B בכמה נקודות, כולל עלייה מ 69.2 ל 74.0 ב AIME24. אם המטרה היא דיוק מקסימלי במתמטיקה מתוך מודל קוד פתוח של 32B, המיזוג הזה מוכיח את עצמו.

האם אפשר להריץ אותו על מחשב נייד חזק?

במשקלים המקוריים ממש לא, כי צריך לפחות 61 גיגה בייט רק כדי לטעון אותו לזיכרון. תוכלו להריץ אותו רק אם תורידו את גרסת ה GGUF המכווצת שלו דרך תוכנות כמו llama.cpp ועם כמות מספקת של זיכרון אחוד.

איך מריצים

במשקל מלא של bfloat16 הקבצים שוקלים 61 גיגה בייט, כך שתצטרכו לפחות 80 גיגה בייט של זיכרון גרפי כמו כרטיס A100 או H100 בודד כדי להחזיק את המודל ואת הקשר הריצה. בקוד הדוגמה הרשמי מריצים אותו דרך vLLM עם חלוקה על פני שמונה כרטיסים במקביל, ומשתמשים בהגדרת פלט של עד 32,768 טוקנים כדי לתת לו מקום לשרשרת החשיבה.

יש לצוות גם גרסת משקלים מכווצת בפורמט GGUF להרצה מקומית צנועה יותר. אם אין לכם גישה לשרת עם כרטיסים מקצועיים או שאתם לא מריצים עיבודים רגישים שחייבים להישאר על הברזלים שלכם, עדיף להשתמש ב API של שירותי ענן שמחזיקים מודלי 32B דומים, כי העלות החודשית של שרת כזה תהיה גבוהה בהרבה.

pip install -U huggingface_hub
hf download FuseAI/FuseO1-DeepSeekR1-QwQ-SkyT1-32B-Preview

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, להריץ אותו בשירותים פנימיים, לשנות את המשקלים ולהפיץ מוצרים שמבוססים עליו, כל עוד שומרים על תנאי הרישיון המקוריים ומתעדים שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗