GPT
D

DeepSeek-V4-Flash

קוד פתוח

deepseek-aimit2026-04-22

  • transformers
  • safetensors
  • deepseek_v4
  • text-generation
  • conversational

זה מודל MoE עם 284 מיליארד פרמטרים שמפעיל רק 13 מיליארד בכל צעד, ומיועד להסקת מסקנות מורכבת בהקשר של מיליון טוקנים עם פחות משאבי חישוב.

  • 291Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 149 GBמשקל הקבצים
  • 1,779,052הורדות בחודש

מה זה

הארכיטקטורה מבוססת על מנגנון מומחים שמאפשר להחזיק נפח ידע של 284 מיליארד פרמטרים, אבל להריץ חישוב של 13 מיליארד פרמטרים בלבד בזמן אמת. המבנה כולל שילוב של מנגנוני תשומת לב דחוסים, שנועדו לקצץ את דרישות החישוב ונפח הזיכרון של זיכרון המצב בריצות ארוכות במיוחד שמגיעות עד מיליון טוקנים.

במדדי ההסקה המודל מציג זינוק חד כשהוא רץ במצב חשיבה ממושך. בבדיקת LiveCodeBench למשל, הציון מזנק מ־55.2 במצב רגיל ל־91.6 במצב חשיבה מרבי. עם זאת, בבדיקות ידע עובדתי טהור כמו SimpleQA-Verified, הגרסה הזו מגיעה ל־34.1 במצב המרבי, הרחק מאחורי גרסת הפרו.

מתאים ל

  • ניתוח מסמכי ענק

    תמיכה בחלון של מיליון טוקנים עם מנגנון תשומת לב דחוס מאפשרת עיבוד טקסטים ארוכים ביעילות.

  • פתרון בעיות קוד קשות

    במצב חשיבה מרבי המודל מגיע לציון 91.6 במדד LiveCodeBench ומסוגל לתכנן פתרונות מורכבים.

  • משימות חישוב ומתמטיקה

    מצב החשיבה מעלה את הדיוק במבחן HMMT 2026 עד ל־94.8 בזכות תהליך בדיקה עצמי.

איפה זה נופל

בלי להפעיל מצבי חשיבה, הביצועים שלו במשימות תכנות והיגיון צונחים לרמות נמוכות מאוד, כמו 8.1 בלבד במבחן HLE. בנוסף, הנפח המצומצם יחסית של המומחים הפעילים פוגע ביכולת שלו לשלוף עובדות מדויקות, ובמבחני עבודה מורכבת של סוכני תוכנה הוא נשאר מאחורי דגמים גדולים יותר.

אותה משפחה

DeepSeek-V4-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בצ'אט רגיל בלי להמתין לחשיבה?

כן, קיים מצב ללא חשיבה שמחזיר תשובות ישירות ומהירות. החיסרון הוא פגיעה משמעותית מאוד בדיוק במשימות של תכנות, מתמטיקה והיגיון מורכב.

איך מטפלים בהזנת הפרומפטים אם אין תבנית שיחה מובנית?

במקום תבנית ג'ינג'ה רגילה של ספריית השנאים, צריך להשתמש בקובצי הפייתון שהועלו למאגר כדי להמיר מערכי הודעות למחרוזת טקסט מתאימה.

איך מריצים

המשקל הכולל של הקבצים עומד על 149 ג'יגה בייט בפורמט מעורב של FP4 ו־FP8, כאשר משקלי המומחים שמורים ברמת דיוק נמוכה של 4 ביט. בשביל לפרוס אותו באופן עצמאי נדרשת תשתית של מספר כרטיסי מסך עם נפח זיכרון ייעודי גדול מספיק להחזקת המשקלים וניהול זיכרון המצב, בעיקר אם מנצלים את מלוא החלון.

מי שאין לו שרת כזה יבחר בגישה דרך שירות ענן. מעבר לזה, המודל אינו כולל תבנית שיחה סטנדרטית בפורמט ג'ינג'ה, ולכן הרצה בקוד דורשת שימוש בסקריפטים הייעודיים שסופקו כדי לקודד הודעות ולפענח את תגיות החשיבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V4-Flash")
print(pipe("שלום"))

הקבצים

73 קבצים במאגר, 149 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שאומר חופש מלא לשימוש מסחרי, שינוי קוד והפצה של המודל בתוך מוצרים. אין כאן מגבלות על מספר משתמשים פעילים, והדרישה היחידה היא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗