GPT
D

bartowski/DeepSeek-V4-Flash-0731-GGUF

קוד פתוח

bartowskimit2026-07-31

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF ענקית למודל של 284 מיליארד פרמטרים, שמביאה דחיסת MXFP4 ישירות להרצה מקומית. מי שמחזיק שרת רציני מקבל מודל פתוח עם תמיכה בהאצת יצירה.

  • 156 GBמשקל הקבצים
  • 6,520הורדות בחודש
  • 40לייקים

מה זה

מדובר בהמרה של המודל המקורי מבית deepseek-ai לפורמט GGUF, שמיועד לעבודה עם llama.cpp וכלים דומים. המודל שוקל 156.38 גיגה בייט ומחזיק 284 מיליארד פרמטרים. המפרסם הוציא אותו בפורמט MXFP4 בלבד, שמייצג את איכות המקור בלי מעבר דרך כיול imatrix בשלב זה.

הייחוד הטכני כאן הוא תמיכה בחיזוי מרובה טוקנים דרך מודל טיוטה חיצוני בשם DSpark. במקום לשלב את משקלי הניבוי בתוך הקובץ הראשי, הם מגיעים בקובץ נפרד ומאפשרים למנוע הריצה להאיץ את קצב הפקת הטקסט. מי שבונה על פתרון מקומי חזק מקבל כאן מענה שלם לייצור טקסט בהיקף גדול, בהנחה שיש לו את הברזלים המתאימים לטפל בנפח כזה.

מתאים ל

  • אירוח מודל גדול בארגון

    מתאים לשרת פנימי שדורש כוח של 284B פרמטרים בלי תלות ברשת חיצונית.

  • הפקת טקסט מואצת

    ניצול מודל הטיוטה DSpark כדי להפיק טוקנים בקצב גבוה על חומרה חזקה.

  • פיתוח עם llama.cpp

    עבודה מול ממשק השרת המקומי או כלים כמו LM Studio בסביבה מבוקרת.

איפה זה נופל

הקובץ שוקל מעל 156 גיגה בייט ואין שום גרסה קלה יותר באופק כרגע, מה שחוסם כמעט כל חומרה ביתית. בנוסף, הכרטיס מבהיר שאין תבנית שיחה מוגדרת והמערכת משתמשת בברירת מחדל שעלולה להיות שגויה, כך שתצטרכו לבדוק את המבנה המקורי ידנית. אין כאן גם כיול imatrix, מה שעלול להשפיע על הדיוק בהשוואה לגרסאות מכוילות.

שאלות
נפוצות

אפשר להריץ את המודל הזה על מחשב נייד או כרטיס בודד?

לא. מדובר ביותר מ־156 גיגה בייט רק למשקלים עצמם. תצטרכו מערך של כמה כרטיסי מסך מתקדמים או כמות חריגה של זיכרון כדי לטעון אותו.

למה מודל הטיוטה DSpark מגיע בקובץ נפרד?

כדי לאפשר הרצה גמישה של פענוח ספקולטיבי בתוך llama.cpp. אפשר להוריד אותו במקביל ולהעביר אותו כפרמטר בהרצה כדי להאיץ את מהירות הפקת הטקסט.

איך מריצים

בשביל להריץ 156 גיגה בייט של מודל מחולק לשבעה קבצים, אתם חייבים שרת עם זיכרון וידאו מאסיבי של כמה כרטיסים מקצועיים או תחנת עבודה ייעודית עם כמות זיכרון מערכת חריגה. אין פה גרסאות קטנות יותר, יש רק MXFP4.

מריצים אותו דרך llama-server עם פקודת ההרצה הרשמית של הכלי, ואפשר לצרף את הדגל של DSpark כדי לקבל האצה. אם אין לכם גישה למחשוב כזה, אין היגיון לשבור את הראש, עדיף בהרבה לפנות ל־API שמארח את המודל המקורי.

ollama run hf.co/bartowski/DeepSeek-V4-Flash-0731-GGUF:DeepSeek-V4-Flash-0731-MXFP4-00003-of-00004

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש חופשי, שינוי קוד והפצה, כולל שילוב מלא במוצרים מסחריים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗