GPT
D

DeepSeek-R1-0528-Qwen3-8B

קוד פתוח

deepseek-aimit2025-05-29

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

זיקוק של יכולות החשיבה מגרסת הדגל אל בסיס קטן של שמונה מיליארד פרמטרים. פתרון מתמטי חזק שמיועד למי שחייב ביצועי היסק גבוהים על חומרה מקומית נגישה.

  • 8.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 972,188הורדות בחודש

מה זה

המודל הזה נוצר מתהליך פוסט אימון שבו זוקקה שרשרת החשיבה של המודל הגדול אל תוך Qwen3 בגרסת 8B Base. המבנה שלו נשען על 36 שכבות בארכיטקטורת Qwen3ForCausalLM, אך הוא משתמש בהגדרות הטוקנייזר של משפחת R1. היכולת המרכזית כאן היא פתרון בעיות שמצריכות היסק מתמטי עמוק, תחום שבו מודלים קטנים נוטים להישבר מהר.

במבחני AIME 2024 הוא מגיע לציון של 86.0, שזה שיפור של עשרה אחוזים לעומת מודל הבסיס ונתון שמשתווה למודלי ענק מרובי מומחים. בגרסת המבחן של 2025 הוא רושם 76.3, ובמבחן LiveCodeBench הוא עומד על 60.5. המשמעות היא שבתרחישי אלגוריתמיקה ממוקדים הוא מייצר פתרונות ברמה שמקבילה למערכות כבדות בהרבה, בלי לשלם עלויות עתק על שרתים ייעודיים.

מתאים ל

  • פתרון בעיות מתמטיקה

    מציג ציון של 86.0 ב־AIME 2024, תוצאה חריגה לגודל של שמונה מיליארד פרמטרים.

  • סיוע באלגוריתמיקה

    מתאים לכתיבת קטעי קוד ממוקדים שדורשים חשיבה לוגית, עם ציון 60.5 במבחן LiveCodeBench.

  • מחקר על שרשראות חשיבה

    מבנה קומפקטי שמבוסס על ארכיטקטורה פתוחה, נוח לניתוח תהליכי היסק מקומיים ללא עלויות ריצה גבוהות.

איפה זה נופל

למרות החוזק במתמטיקה טהורה, המודל הזה מתקשה יותר במבחני ידע כללי מורכבים. בבדיקת GPQA Diamond הוא מגיע לציון של 61.1 בלבד, נמוך משמעותית ממודלים מסחריים כמו Gemini 2.5 Flash Thinking שעומד על 82.8, ונמוך אף מגרסת הבסיס המקורית באותו מבחן. בנוסף, ציון של 60.5 בקידוד מעיד על כך שהוא אינו תחליף מלא למודלי פיתוח ייעודיים. אסור להניח שיכולות החישוב שלו מעידות על הבנה רחבה של שאלות מדעיות מופשטות.

שאלות
נפוצות

האם אפשר להשתמש בקובצי התצורה של Qwen3 המקורי?

לא. המודל אמנם חולק את אותה ארכיטקטורה פנימית, אבל משתמש בטוקנייזר של משפחת R1. חובה לוודא שמושכים את קובצי הקונפיגורציה ישירות ממאגר המודל הזה כדי למנוע שיבושים בפענוח הטקסט.

האם המודל דורש תגית מיוחדת כדי להתחיל לחשוב?

אין צורך להוסיף ידנית תגית חשיבה בתחילת הפלט. בשונה מגרסאות R1 קודמות, ההתנהגות הזו מובנית והוא נכנס למצב היסק באופן טבעי.

איך מריצים

המשקלים תופסים 15.3 גיגה בייט בפורמט bfloat16 על פני עשרה קבצים. כדי לטעון אותו במלואו נדרש כרטיס מסך בודד עם 24 גיגה זיכרון, כמו כרטיסי שוק מקצועי או תחנות עבודה חזקות. אם חלון ההקשר מנוצל לעומק, דרישת הזיכרון תעלה מעבר לזה, ולכן שימוש בענן או בגרסאות מכווצות עשוי להיות בלתי נמנע על ציוד שולחני רגיל.

ההרצה מתבצעת דרך ספריית transformers הרגילה, תוך הקפדה מפורשת למשוך את קובצי ההגדרה מהמאגר הזה ולא מהפרויקט המקורי של Qwen3. ברירת המחדל לטמפרטורה היא 0.6. אין צורך להזריק תגית תחילת חשיבה כדי להפעיל את תהליך ההיסק, והוא תומך בהנחיות מערכת ישירות.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-R1-0528-Qwen3-8B")
print(pipe("שלום"))

הרישיון

רישיון MIT מלא, שמאפשר שימוש מסחרי חופשי, שינוי קוד, הפצה וזיקוק מודלים נוספים מתוכו. המשמעות עבורכם היא שניתן להטמיע אותו במוצרים מסחריים או בשרתים פנימיים ללא תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗