GPT
D

unsloth/DeepSeek-V4-Flash

קוד פתוח

unslothmit2026-04-24

  • transformers
  • safetensors
  • deepseek_v4
  • text-generation
  • unsloth

גרסת MoE קלה יותר עם הקשר של מיליון טוקנים ו־13 מיליארד פרמטרים פעילים, שנותנת ביצועי חשיבה וקוד גבוהים בלי הדרישות המפלצתיות של גרסת הפרו.

  • 158Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 149 GBמשקל הקבצים
  • 1,431הורדות בחודש

מה זה

המאגר הזה מציג את גרסת ה־Flash מתוך סדרת DeepSeek-V4, שפורסמה כאן דרך unsloth. המודל כולו מכיל 158 מיליארד פרמטרים במבנה של 43 שכבות, אך בזכות ארכיטקטורת MoE הוא מפעיל רק 13 מיליארד פרמטרים בכל טוקן. המטרה כאן היא לאפשר ריצה יעילה בהרבה תוך תמיכה בחלון הקשר ענק של 1,048,576 טוקנים. הארכיטקטורה משלבת מנגנוני תשומת לב דחוסים כמו CSA ו־HCA, שנועדו להקטין דרסטית את גודל ה־KV cache ואת עלויות החישוב בטקסטים ארוכים.

במבחני ביצועים, המודל מציג פער ברור בין משימות ידע כללי לבין חשיבה טהורה. במצב חשיבה מקסימלי, Flash מגיע ל־91.6 ב־LiveCodeBench ולדירוג 3052 ב־Codeforces, שזה קרוב מאוד לגרסת ה־Pro הגדולה בהרבה. מצד שני, במבחני עובדות פשוטים כמו SimpleQA-Verified הוא נעצר על 34.1 בלבד, לעומת 57.9 של גרסת ה־Pro, כך שנפח הפרמטרים הכולל משפיע ישירות על הידע האנציקלופדי שנשמר בו.

מתאים ל

  • פתרון בעיות תכנות מורכבות

    במצב חשיבה מקסימלי הוא מגיע ל־91.6 ב־LiveCodeBench, מעולה לניתוח באגים ולוגיקה.

  • ניתוח מסמכים ארוכים

    חלון של מיליון טוקנים מאפשר לקרוא קבצי קוד עצומים וספרים שלמים בבקשה אחת.

  • אוטומציית סביבות פיתוח

    הוא מציג 79 אחוז פתרון ב־SWE Verified, ולכן מתאים להרצת משימות כסוכן תוכנה עצמאי.

איפה זה נופל

בלי מנגנון החשיבה המופעל, המודל מתרסק במשימות מורכבות. במצב Non-think הוא מקבל רק 55.2 ב־LiveCodeBench ו־1.0 בודד ב־Apex, כך שאסור לבנות עליו לפקודות קוד מהירות בלי להקצות לו תקציב טוקנים לחשיבה. בנוסף, חסר כאן קובץ Jinja סטנדרטי עבור תבנית השיחה, והוא דורש סקריפטים ייעודיים של פייתון שמגיעים בתיקייה נפרדת כדי לקודד הודעות ולפענח את התשובות.

אותה משפחה

DeepSeek-V4-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות בספריית transformers הרגילה?

כן, המודל נתמך בספרייה, אבל הוא לא מכיל תבנית שיחה מובנית מסוג Jinja. תצטרכו להשתמש בסקריפטים של המפתחים מתיקיית הקידוד כדי להמיר מערכי הודעות למחרוזת מתאימה ולפרק את מקטעי החשיבה מהפלט.

מה ההבדל המרכזי בין מצבי הריצה השונים של המודל?

ישנם שלושה מצבים: Non-think שמחזיר תשובה ישירה אך משיג תוצאות נמוכות במיוחד במתמטיקה וקוד, Think High שמפעיל חשיבה לוגית עמוקה, ו־Think Max שמנצל את מלוא תקציב החשיבה ודורש חלון הקשר של לפחות 384 אלף טוקנים.

איך מריצים

המשקל הכולל של הקבצים עומד על 149 ג'יגה־בייט בדיוק bfloat16 שמחולק ל־76 קבצים. כדי להרים אותו מקומית צריך שרת רציני עם כמה כרטיסי GPU מודרניים שיכולים להכיל לפחות 160 עד 200 ג'יגה זיכרון גרפי עבור המודל וה־KV cache, במיוחד אם רוצים לנצל הקשרים ארוכים.

המפתחים ממליצים להגדיר חלון של לפחות 384 אלף טוקנים עבור מצב החשיבה המרבי, עם טמפרטורה 1.0 ו־top_p 1.0. אם אתם צריכים רק מענה מהיר או בדיקות נקודתיות בלי ציוד ייעודי של כמה עשרות אלפי שקלים, עדיף להשתמש ב־API מרוחק במקום לנסות להחזיק אשכול שרתים פרטי.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/DeepSeek-V4-Flash")
print(pipe("שלום"))

הקבצים

76 קבצים במאגר, 149 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר להשתמש במודל לשימוש מסחרי חופשי, לשנות אותו, להפיץ אותו ולשלב אותו בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הוויתור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗