GPT
D

DeepSeek-V4-Pro-DSpark

קוד פתוח

deepseek-aimit2026-06-27

  • transformers
  • safetensors
  • deepseek_v4
  • text-generation
  • endpoints_compatible

גרסה זו מצמידה מודול פענוח ספקולטיבי למודל של 1.6T פרמטרים. היא נועדה להאיץ מהירות יצירה בהקשר של מיליון טוקנים בלי לשנות את המשקלים המקוריים.

  • 1650Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 831 GBמשקל הקבצים
  • 3,431הורדות בחודש

מה זה

המודל מבוסס על ארכיטקטורת תערובת מומחים עם 1,650 מיליארד פרמטרים בסך הכול, אך מפעיל בפועל רק 49 מיליארד בכל צעד. הוא תומך בחלון הקשר של 1,048,576 טוקנים, ומשלב תשומת לב היברידית שמורידה את דרישות זיכרון ה־KV cache לעשירית ביחס לגרסה הקודמת. נקודת המשקל הזו זהה למודל הבסיסי, אך כוללת רכיב פענוח ספקולטיבי בשם DSpark לקיצור זמני ההסקה.

במבחני ביצועים במצב חשיבה מרבי, המערך מציג יכולות קידוד ומתמטיקה גבוהות במיוחד עם ציון של 93.5 ב־LiveCodeBench ודירוג 3206 ב־Codeforces. במשימות הקשר ארוך בתוך מיליון טוקנים הוא מגיע ל־83.5 ב־MRCR, מעל Gemini-3.1-Pro אך מתחת ל־Opus-4.6. במשימות סוכנים והפעלת כלים המדדים נעים סביב 80.6 ב־SWE Verified, צמוד למודלים המסחריים המובילים.

מתאים ל

  • פתרון בעיות קוד תחרותי

    דירוג 3206 ב־Codeforces ו־93.5 ב־LiveCodeBench הופכים אותו לכלי חזק לפיתוח אלגוריתמים מורכבים.

  • ניתוח מסמכים באורך קיצון

    תמיכה במיליון טוקנים עם דחיסת זיכרון יעילה מאפשרת סריקה ותשאול של קובצי ענק בקריאה אחת.

  • מערכות סוכנים לפיתוח תוכנה

    ציון של 80.6 ב־SWE Verified מתאים להרצת תהליכי אוטומציה של בדיקות ותיקון באגים במאגרי קוד.

איפה זה נופל

למרות גודלו, במשימות ידע כללי מורכבות כמו GPQA Diamond הוא משיג 90.1, נמוך יותר ממתחריו המובילים. כמו כן, בבנצ'מרק HLE המודל נעצר על 37.7 נקודות, וכאשר משלבים כלים חיצוניים הביצועים מגיעים ל־48.2 בלבד, שזה פחות מ־K2.6 ומ־Opus. המודל גם מגיע ללא תבנית שיחה מובנית בפורמט Jinja המקובל, כך שחובה להשתמש בסקריפטי קידוד ייעודיים כדי לפרסר הודעות וטקסט חשיבה כראוי.

שאלות
נפוצות

במה גרסת ה־DSpark שונה מגרסת ה־Pro הרגילה?

המשקלים הבסיסיים זהים לחלוטין. ההבדל היחיד הוא תוספת של מודול פענוח ספקולטיבי שמייצר כמה טוקנים במקביל ומאיץ את תהליך ההסקה בפועל.

האם אפשר להריץ את המודל הזה על שרת מקומי רגיל?

לא. נדרשת חומרה כבדה מאוד ברמת שרתים של ארבעה מאיצי GB300 לפחות, בין היתר בגלל נפח משקלים של 831 גיגה־בייט ומבנה מורכב של 61 שכבות.

איך משתמשים בתבנית השיחה בהיעדר קובץ Jinja מובנה?

צריך לייבא את פונקציות הקידוד הייעודיות שמגיעות בתיקיית encoding של הפרויקט כדי להמיר מערכי הודעות למחרוזת טוקנים מתאימה.

איך מריצים

המשקל הכולל של הקבצים עומד על 831 גיגה־בייט בדיוק bfloat16, מה שהופך הרצה מקומית על תחנת עבודה רגילה לבלתי אפשרית. תיעוד ההרצה הרשמי ב־vLLM דורש צומת של ארבעה מאיצי GB300 עם שימוש בדחיסת fp8 לזיכרון ודגלי האצה מיוחדים למומחים.

אם אין לכם תשתית שרתים ייעודית בעלות של מאות אלפי שקלים, אין טעם להוריד את המשקלים. במקרה כזה עדיף לצרוך את המודל דרך ספקי API שתומכים בו, אלא אם קיימת חובת עמידה ברגולציית פרטיות הדורשת התקנה מקומית סגורה לחלוטין.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V4-Pro-DSpark")
print(pipe("שלום"))

הקבצים

92 קבצים במאגר, 831 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט והמשקלים מופצים תחת רישיון MIT. המשמעות היא חופש מלא לשימוש מסחרי, שינוי, הפצה והטמעה במוצרים פנימיים או מסחריים, ללא תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗