GPT
D

DeepSeek-V4-Flash-0731-GGUF

קוד פתוח

unslothmit2026-07-31

  • gguf
  • unsloth
  • deepseek_v4
  • deepseek
  • endpoints_compatible

גרסת קוונטיזציה של מודל קוד וסוכנים חזק, שמיועדת למי שחייב ביצועים מקומיים של מודל ענק בלי להחזיק חוות שרתים שלמה.

  • 1.4 TBמשקל הקבצים
  • 284,442הורדות בחודש
  • 759לייקים

מה זה

מדובר בגרסת GGUF רשמית של מודל ממוקד סוכנים ומשימות פיתוח, שכולל מודול פענוח ספקולטיבי מובנה בשם DSpark להאצת יצירת הטקסט עד פי שניים. בגרסה הזו הוסיפו מצבי חשיבה מתקדמים, מה שעוזר לו להתמודד עם פתרון בעיות תכנותיות מורכבות.

במבחני הביצועים הוא עוקף את גרסת הפרו המוקדמת כמעט בכל מדד, במיוחד במשימות פיתוח תוכנה כמו DeepSWE שבה זינק מציון של 7.3 לציון 54.4. הוא עדיין מפגר מעט אחרי מודלים מסחריים סגורים כמו אופוס במבחנים מסוימים, אבל בהפעלת כלים וטרמינל הוא סוגר את הפער בצורה מורגשת.

מתאים ל

  • סוכן לפיתוח תוכנה מקומי

    מתאים לפתרון באגים וכתיבת קוד ישירות מול מאגרי קוד, בזכות שיפור חד במבחני DeepSWE וסביבת טרמינל.

  • אוטומציה של כלי מערכת

    עובד היטב מול שורת הפקודה והפעלת כלים חיצוניים, עם ציון של 82.7 במבחן טרמינל.

  • מערכות ללא תלות בענן

    פתרון טוב לארגונים שחייבים ריצה מקומית מלאה ברישיון MIT חופשי בלי דליפת נתונים החוצה.

איפה זה נופל

המודל מציג ציונים נמוכים מאוד במבחנים של אוטומציה מורכבת ועמידה במשימות סוכן קיצוניות, עם 25.1 ב־AutomationBench וציון של 25.2 בלבד בבחינת הסוכנים. בנוסף, כל התוצאות הגבוהות בכרטיס הושגו תחת מצב מאמץ חשיבה מקסימלי עם מסגרת סוכנים פנימית שטרם שוחררה, כך שבריצה מקומית רגילה בלי המעטפת הזו אתם צפויים לראות פגיעה משמעותית ביכולות.

שאלות
נפוצות

איזו גרסת קוונטיזציה כדאי להוריד?

עדיף ללכת ישירות על UD-Q8_K_XL ששוקלת 162 גיגה בייט. היא גדולה רק בשבעה גיגה בייט מגרסת Q4 ומספקת דיוק מלא ללא איבוד מידע מורגש.

האם המודל מהיר בריצה מקומית?

הוא כולל מודול פענוח ספקולטיבי בשם DSpark שאמור להכפיל את קצב הפקת הטוקנים. יחד עם זאת, מדובר במודל שדורש מעל 150 גיגה בייט בזיכרון, כך שעל חומרה לא מתאימה הוא עדיין ירוץ לאט.

האם אפשר להשתמש בו במוצר מסחרי?

כן, המודל מפורסם תחת רישיון MIT מלא. אתם רשאים להריץ אותו, לעטוף אותו במוצר שלכם ולגבות כסף ממשתמשים ללא הגבלות מסחריות.

איך מריצים

כדי להריץ את גרסת הדיוק הגבוהה UD-Q8_K_XL תצטרכו לפנות 162 גיגה בייט בזיכרון, שזה רק שבעה גיגה בייט יותר מגרסת Q4 שעומדת על 155 גיגה בייט. בהפרש כזה אין סיבה אמיתית להתפשר על גרסת הארבעה ביט אם יש לכם את החומרה המתאימה, אבל עדיין מדובר בדרישת זיכרון עצומה שמחייבת מערך כרטיסים מקצועי.

אם אתם לא מחזיקים שרת ייעודי כזה בבית או בענן פרטי, אין שום היגיון לנסות להריץ את זה מקומית. עדיף לקרוא ל־API חיצוני ולשלם לפי טוקן, במקום לשלם על חשמל וכרטיסי מסך יקרים רק כדי לגלות שקצב היצירה אטי מדי.

ollama run hf.co/unsloth/DeepSeek-V4-Flash-0731-GGUF:Q8_K_XL

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

54 קבצים במאגר, 1.4 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט ומשקלי המודל מופצים תחת רישיון MIT, וזה הרישיון הכי פתוח שאפשר לבקש. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר ולמכור גישה אליו, בלי תמלוגים ובלי חובת שיתוף של הקוד שלכם. הדרישה היחידה היא לשמור על הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗