GPT
D

DeepSeek-V4-Flash-0731

קוד פתוח

deepseek-aimit2026-07-31

  • transformers
  • safetensors
  • deepseek_v4
  • text-generation
  • conversational

גרסה רשמית של מודל שפה עם ארכיטקטורת מומחים ומודול האצה מובנה. הוא פונה למי שבונה סוכנים אוטומטיים וצריך ריצה מהירה בהקשרים ארוכים במיוחד.

  • 304Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 155 GBמשקל הקבצים
  • 4,425,802הורדות בחודש

מה זה

המודל מציג זינוק חד ביכולות סוכנים בהשוואה לגרסת התצוגה המקדימה שלו. במבחני פיתוח תוכנה כמו DeepSWE הוא קופץ מציון של 7.3 ל־54.4, ובמשימות טרמינל הוא מגיע ל־82.7. המדידות האלו מראות שהוא מסוגל לתפעל כלים ולכתוב קוד ברמה שמתחרה במודלים קנייניים כבדים בהרבה, תוך שמירה על מספר פרמטרים מופעלים נמוך יחסית.

הייחוד כאן הוא שילוב מובנה של מנגנון פיענוח ספקולטיבי מאותם משקלים, בלי צורך במודל טיוטה נפרד. לצד זה, חלון ההקשר מגיע למיליון טוקנים, מה שמאפשר להזין מאגרי קוד שלמים או היסטוריית ריצה ארוכה בלי לחתוך נתונים בדרך.

מתאים ל

  • סוכני פיתוח תוכנה

    מתאים לפתרון בעיות בריפו, עבודה מול טרמינל והרצת בדיקות אוטומטיות בזכות דיוק גבוה במבחני DSBench.

  • ניתוח מאגרי קוד גדולים

    חלון הקשר של מיליון טוקנים מאפשר לטעון פרויקטים שלמים ולבצע תהליכי ריפקטורינג מורכבים.

  • שילוב מערכות מבוססות כלים

    מציג תוצאה של 70.3 במבחן Toolathlon ומסוגל לנהל שרשרת קריאות לפונקציות חיצוניות בדיוק רב.

איפה זה נופל

המודל דורש עבודה לא שגרתית ברמת הקוד. אין לו תבנית צ'אט סטנדרטית בפורמט Jinja, וצריך להשתמש בסקריפטים ייעודיים כדי לקודד קלטים ולפרסר את הפלטים. בנוסף, כדי לקבל את הביצועים המרביים במשימות תכנות, הוא נבדק תחת רמת מאמץ חשיבה מקסימלית, מה שעלול לייצר זמני תגובה ארוכים וצריכת טוקנים כבדה.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על שרת מקומי עם כרטיס RTX בודד?

לא, המשקלים עצמם שוקלים 155 גיגה בייטים ודורשים חלוקה על פני כמה מאיצי שרת חזקים. תצורת המינימום המתועדת מבוססת על צומת של ארבעה כרטיסי GB300. למחשב מקומי עדיף להשתמש בחיבור רשת לשירות שמארח אותו.

איך משלבים אותו בספריות תוכנה אם אין תבנית צ'אט רגילה?

היוצרים מספקים תיקיית סקריפטים בפייתון שממירה הודעות ממבנה סטנדרטי למחרוזת שהמודל מבין. תצטרכו להטמיע את הממיר הזה בצד השרת שלכם לפני שליחת הטוקנים למנוע ההרצה, ולפרסר את התשובה כדי להפריד בין תהליך החשיבה לטקסט הסופי.

איך מריצים

כדי להריץ אותו עצמאית תצטרכו חומרת שרתים רצינית. הדוגמאות הרשמיות של vLLM ו־SGLang דורשות צומת של ארבעה מאיצי GB300, לצד שימוש בקוונטיזציה של זיכרון הקשר ב־FP8 וקריאת קוד מרוחק. עם 155 גיגה בייטים של משקלים, אי אפשר להפעיל אותו על מחשב מקומי רגיל.

אם אין לכם קלאסטר כזה בענן או בדאטה סנטר, עדיף לפנות ל־API שמארח אותו. פריסה עצמית שווה את המאמץ רק אם אתם חייבים פרטיות מוחלטת למידע או שאתם מריצים נפח שאילתות עצום שמצדיק עלויות שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V4-Flash-0731")
print(pipe("שלום"))

הקבצים

74 קבצים במאגר, 155 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט ומשקלי המודל משוחררים תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗