GPT
D

DeepSeek-V4-Flash-DSpark

קוד פתוח

deepseek-aimit2026-06-27

  • transformers
  • safetensors
  • deepseek_v4
  • text-generation
  • endpoints_compatible

גרסה שמלבישה מודול פענוח ספקולטיבי על מודל ענק עם מיליון טוקנים הקשר. אתם רוצים אותה רק אם אתם מריצים הסקה עצמאית ומחפשים תפוקת טוקנים מהירה בלי לאבד דיוק.

  • 165Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 155 GBמשקל הקבצים
  • 688,421הורדות בחודש

מה זה

המשקל הזה אינו מודל חדש מאפס, אלא אותו צ'קפוינט של פלאש עם תוספת מודול שנקרא DSpark לפענוח ספקולטיבי. מדובר בארכיטקטורת תערובת מומחים עם מאה שישים וחמישה מיליארד פרמטרים שיושבים בקבצים, שמתוכם רק חלק קטן פעיל בכל טוקן, לצד תמיכה בחלון הקשר של מיליון טוקנים בעזרת מנגנון קשב דחוס.

במבחני ביצועים, המודל הזה מתחרה ישירות במודלים הגדולים ביותר כשהוא במצב חשיבה מקסימלי. במבחן הקוד LiveCodeBench גרסת המקס מגיעה לתוצאה של 91.6 נקודות, ובמבחן המתמטיקה HMMT היא מגיעה ל־94.8 אחוזים. עם זאת, במשימות ידע כללי טהור כמו SimpleQA המודל משיג רק 34.1 אחוזים, פער מורגש מול גרסת הפרו הגדולה שמגיעה ל־57.9 אחוזים.

מתאים ל

  • פתרון בעיות תכנות

    משיג תוצאה של 91.6 במבחן LiveCodeBench במצב חשיבה גבוה, ומתאים לניתוח שגיאות קוד מורכבות.

  • עיבוד מסמכים עצומים

    תומך בחלון של מיליון טוקנים עם דחיסת זיכרון ייעודית שמאפשרת תחקור מאגרי טקסט גדולים.

  • שרת הסקה מהיר

    מודול ה־DSpark מאפשר לייצר טוקנים בקצב גבוה משמעותית בהרצה מקומית מבוססת vLLM.

איפה זה נופל

במצב הרגיל ללא חשיבה המודל מתרסק במשימות מורכבות, עם ציון נמוך של אחוז אחד בלבד במבחן Apex וציון של 8.1 אחוזים ב־HLE. מעבר לכך, במשימות ארוכות טווח ללא מחשבה מוקדמת התוצאות בהקשר של מיליון טוקנים צונחות ל־15.5 אחוזים ב־CorpusQA. בנוסף, אין כאן תבנית שיחה מובנית מבוססת Jinja, מה שמחייב שימוש בסקריפטי קידוד ידניים בפייתון כדי לפרסר קלט ופלט.

שאלות
נפוצות

האם המודל שונה באיכות התוכן שלו מגרסת הפלאש הרגילה?

לא. מדובר באותם משקולות בדיוק כמו של גרסת הפלאש, כשרק נוספה שכבת פענוח ספקולטיבי שמטרתה להאיץ את מהירות הפלט בזמן הריצה.

האם אפשר להשתמש בו ישירות בספריות צ'אט סטנדרטיות?

לא באופן מיידי. המפרסמים לא כללו תבנית שיחה מסוג Jinja, ולכן צריך לייבא את סקריפט הקידוד שלהם מפייתון כדי לפרמט הודעות ולחלץ את בלוק החשיבה.

איך מריצים

כדי להריץ את הדבר הזה מקומית תצטרכו שרת כבד מאוד. הדוגמה הרשמית מציגה הרצה על צומת של ארבעה מאיצי GB300 באמצעות vLLM, תוך הפעלת מנגנוני מקבול מומחים, דחיסת זיכרון הקשר בפורמט שמונה ביט והגדרת הפענוח הספקולטיבי עם שבעה טוקנים קדימה.

אם אין לכם קלאסטר כזה בענן או בדאטה סנטר, אין מה לנסות להוריד מאה חמישים וחמישה ג'יגה בייט של קבצים למחשב מקומי. במקרים כאלה עדיף לגשת ישירות ל־API ייעודי שחוסך את כל כאב הראש של ניהול הזיכרון והתשתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V4-Flash-DSpark")
print(pipe("שלום"))

הקבצים

74 קבצים במאגר, 155 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפצה תחת רישיון MIT מלא, שזה המצב הפתוח והנוח ביותר שקיים. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר סגור או להציע אותו כשירות, כל עוד משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗