GPT
D

DeepSeek-V4-Pro-0813

קוד פתוח

deepseek-aimit2026-08-13

  • transformers
  • safetensors
  • deepseek_v4
  • text-generation
  • conversational

גרסת פרו רשמית במשקל של כמעט טרה בייט שמכוונת לפיתוח סוכנים אוטונומיים ומשימות קוד מורכבות. היא מגיעה עם תמיכה בהסקה ספקולטיבית מובנית וחלון הקשר של מיליון טוקנים.

  • 1650Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 831 GBמשקל הקבצים
  • 164,699הורדות בחודש

מה זה

מדובר במודל ענק של 1650 מיליארד פרמטרים שמחליף את גרסת התצוגה המקדימה, עם דגש מובהק על עבודה עם כלים והרצת פקודות בסביבות פיתוח. המודל משלב מודול בשם DSpark לטובת speculative decoding שמשפר את קצב הייצור בזמן אמת, וכולל אפשרות לשלוט בעומק החשיבה שלו בשלוש רמות שונות לפני שהוא עונה.

במבחני הביצועים הוא מציג קפיצה חדה לעומת גרסת הפריוויו, במיוחד במשימות פיתוח תוכנה. במבחן DeepSWE הוא זינק מציון של 12.8 לציון של 62.7, ובמבחן Cybergym הוא מגיע ל־83.3 לעומת 52.7 בעבר. הוא מנצח מתחרים כמו Opus-4.8 בחלק ממבחני הטרמינל והאוטומציה, אבל עדיין מפגר מאחוריו במשימות מעבר מתוכן לפרויקט מלא כמו NL2Repo, שם רשם 61.5 לעומת 69.7.

מתאים ל

  • סוכני תיקון קוד ובדיקות

    הוא מגיע לציון 62.7 במבחן DeepSWE ומיועד לפתרון תקלות עמוקות במאגרי קוד גדולים.

  • אוטומציה של פקודות טרמינל

    עם תוצאה של 87.9 ב־Terminal Bench, הוא מסוגל לנהל סביבות שרתים והרצת פקודות מורכבות.

  • עבודה מול כלים ו־APIs

    הוא מותאם לעבודה ברצף פעולות עם כלי מערכת, עם 74.1 נקודות במבחן Toolathlon.

איפה זה נופל

השילוב שלו באפליקציות קיימות דורש התאמות ידניות כי אין כאן קובץ Jinja סטנדרטי לתבנית השיחה, אלא סקריפטים ייעודיים בפייתון לקידוד ולפיענוח התוכן. במבחני סוכנים קיצוניים כמו Agents' Last Exam הוא עדיין מגרד רק 25.7, ובאוטומציה כללית הוא עומד על 31.8. בנוסף, כדי לקבל ממנו את התוצאות הגבוהות נדרש מאמץ חשיבה מרבי שמייצר עשרות אלפי טוקנים של הסקה ומנפח משמעותית את זמן ההמתנה לתשובה.

שאלות
נפוצות

האם אפשר להשתמש בספריית transformers הרגילה בלי הגדרות מיוחדות?

הטוקנייזר עצמו נטען דרך transformers, אבל תבנית השיחה הרגילה לא תעבוד ישר מהקופסה. תצטרכו להשתמש בסקריפטים שמגיעים בתיקיית encoding כדי לבנות את הפרומפט ולפענח את בלוק החשיבה שהמודל מחזיר.

איך מפעילים את מהירות הדגימה הגבוהה שמבטיחים בכרטיס?

מגדירים את מודול ה־DSpark בהפעלת vLLM או SGLang לפי ההנחיות. מכיוון שמודל הטיוטה מוטמע ישירות בתוך המשקולות של המודל, אין צורך להגדיר קובץ חיצוני נפרד.

איך מריצים

כדי להריץ מפלצת כזו של 831 גיגה בייט בפורמט bfloat16 דרושה חומרת שרתים כבדה מאוד. ההמלצה של המפתחים מדברת על צומת של ארבעה מאיצי GB300, לצד הגדרות קאש מסוג fp8 או fp4 בתוך מנועים כמו vLLM או SGLang. חובה להפעיל את הדגל trust-remote-code, וכדי לנצל את מודול ה־DSpark המובנה אין צורך להוריד מודל טיוטה נפרד כי המשקולות כבר כלולות.

עבור רוב המפתחים והצוותים המקומיים, להרים שרת כזה באופן עצמאי זה פרויקט יקר ומסורבל מאוד מבחינת תשתיות וקירור. אם אתם לא מחויבים להחזיק את המידע בארץ בגלל דרישות אבטחה או רגולציה מקומית מחמירה, קריאה ל־API תחסוך לכם כאב ראש ענק בעלויות החומרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V4-Pro-0813")
print(pipe("שלום"))

הקבצים

92 קבצים במאגר, 831 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות מופצים תחת רישיון MIT. המשמעות היא חופש מלא לעשות במודל כמעט כל מה שתרצו, כולל שימוש מסחרי מלא, שינוי המשקולות ושילוב שלהן במוצר שאתם מוכרים, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗