GPT
D

DeepSeek-V4-Flash-GGUF

קוד פתוח

unslothmit2026-07-06

  • gguf
  • deepseek_v4
  • unsloth
  • deepseek
  • endpoints_compatible

גרסת קוונטיזציה רחבה של 284 מיליארד פרמטרים שמפעילה רק 13 מיליארד בכל שלב. מתאימה למי שרוצה חלון עבודה עצום של מיליון טוקנים בלי צורך בשרתי ענק של טריליון פרמטרים.

  • 1,048,576טוקנים בהקשר
  • 1.4 TBמשקל הקבצים
  • 36,248הורדות בחודש
  • 249לייקים

מה זה

מדובר בארכיטקטורת MoE שמבוססת על 43 שכבות ומערך של 284 מיליארד פרמטרים, כאשר בזמן ריצה מופעלים 13 מיליארד בלבד. המודל אומן על יותר מ־32 טריליון טוקנים ומשתמש במנגנון שמשלב CSA ו־HCA כדי לצמצם את דרישות זיכרון ה־KV וחישובי ה־FLOPs בהקשרים ארוכים. התוצאות מראות שהוא מצטיין בעיקר כשיש לו תקציב חשיבה גבוה, עם ציון של 91.6 ב־LiveCodeBench במצב Max לעומת 55.2 במצב רגיל, ו־94.8 במבחן HMMT לעומת 40.8 בלבד ללא חשיבה.

ביחס לגרסת ה־Pro המלאה שמגיעה ל־1.6 טריליון פרמטרים, הדגם הזה משלם מחיר בידע עולם כללי ובמשימות סוכנים מורכבות. במבחן SimpleQA הוא מקבל 34.1 במצב Max לעומת 57.9 ב־Pro, וב־SWE Pro הוא מגיע ל־52.6 לעומת 55.4. עם זאת, במתמטיקה ובחלק ממבחני הקוד ההבדל בינו לבין הגרסה הגדולה מצטמצם מאוד כאשר מפעילים חשיבה מעמיקה.

מתאים ל

  • ניתוח קוד מורכב במצב חשיבה

    מגיע ל־91.6 ב־LiveCodeBench בזכות ניתוב של 13 מיליארד פרמטרים פעילים מתוך 284 מיליארד.

  • עיבוד מסמכים באורך חריג

    מנגנוני הקשב מאפשרים עבודה עם חלון של מיליון טוקנים תוך שמירה על דרישות זיכרון נמוכות.

  • פתרון בעיות מתמטיות מתקדמות

    משיג 94.8 ב־HMMT במצב חשיבה מקסימלי, שמשתווה כמעט לביצועי גרסאות הענק.

איפה זה נופל

במצב ללא חשיבה המודל חלש משמעותית. הוא מקבל ציון נמוך של 8.1 בלבד במבחן HLE ו־1.0 במבחן Apex, לעומת 34.8 ו־33.0 במצב Max. כלומר, אי אפשר להסתמך עליו למשימות מהירות הדורשות ניתוח בלי להפעיל את מנגנון ה־think. בנוסף, המודל המקורי לא כולל תבנית שיחה מוכנה מסוג Jinja, מה שדורש שימוש בסקריפטים ייעודיים לקידוד הודעות ופענוח פלט.

אותה משפחה

DeepSeek-V4-Flash יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על תחנת עבודה רגילה?

לא. קובץ ה־Q8 שוקל 162 גיגה־בייט, כך שדרוש שרת עם זיכרון גרפי נרחב מאוד או מערך מרובה כרטיסים רק כדי לטעון אותו, עוד לפני חישוב זיכרון ההקשר.

מה ההבדל בין מצבי החשיבה במודל?

מצב Non-think מחזיר תשובה ישירה אך מציג ביצועים נמוכים במיוחד. מצבי High ו־Max מפעילים תהליך חשיבה מפורט שמעלה באופן דרמטי את רמת הדיוק בקוד ובמתמטיקה, אך דורשים חלון הקשר של 384 אלף טוקנים לפחות.

מדוע Unsloth שחררו גרסה זו אם קיים דגם רשמי?

הם יצרו המרות GGUF בטכנולוגיית Dynamic 2.0 שנועדו להרצה ב־llama.cpp, והוסיפו תבנית שיחה מתוקנת לאחר בדיקה של אלפי שיחות.

איך מריצים

המודל שוקל סביב 1.4 טרה־בייט ב־52 קבצים, כך שלא מדובר בכלי למחשב שולחני רגיל. גרסת Q8 ששוקלת 162 גיגה־בייט מוגדרת כנטולת איבוד דיוק לעומת המקור, בעוד שגרסת Q4 קטנה ממנה ב־7 גיגה־בייט בלבד. להרצה נכונה של קובצי ה־GGUF צריך גרסה עדכנית של llama.cpp או שימוש ב־Unsloth Studio, שתומך גם במעבר בין מצבי החשיבה השונים.

אם אין לכם מערך ייעודי של כמה מאיצים עתירי זיכרון כדי לאחסן לפחות 160 גיגה־בייט לגרסה המכווצת, עדיף להשתמש ב־API מרוחק. הרצה מקומית שווה את ההשקעה רק כאשר המידע שלכם חייב להישאר לחלוטין בתוך הרשת הפרטית.

ollama run hf.co/unsloth/DeepSeek-V4-Flash-GGUF:IQ2_XXS

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

52 קבצים במאגר, 1.4 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט ומשקולות המודל מפורסמים תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי, הפצה ושילוב במוצרים סגורים בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗