GPT
D

DeepSeek-V3.1-Terminus-GGUF

קוד פתוח

unslothmit2025-09-22

  • transformers
  • gguf
  • endpoints_compatible
  • imatrix
  • conversational

גרסת קוונטיזציה בפורמט GGUF למודל הענק של דיפסיק, שמתקנת תבניות שיחה ומיועדת להרצה מקומית. מי שבוחר בה מחפש יכולות סוכנים וכתיבת קוד בלי לשלוח נתונים החוצה.

  • 10.0 TBמשקל הקבצים
  • 1,907הורדות בחודש
  • 69לייקים

מה זה

מדובר בעדכון למודל DeepSeek-V3.1 שנארז על ידי Unsloth בפורמט GGUF, הכולל התאמות לתבנית הצ'אט כדי שיעבוד תקין עם מנועי llama.cpp. העדכון הזה מתמקד בצמצום תופעות של ערבוב סינית ואנגלית בפלט, יישור תווים חריגים, ושיפור יכולות העבודה מול כלים חיצוניים כמו חיפוש וסוכני פיתוח.

במבחנים מול גרסת הבסיס, השיפור מורגש בעיקר בהפעלת כלים. בבדיקת SWE Verified לתיקון באגים אמיתיים הוא עולה מ־66.0 ל־68.4, ב־BrowseComp הוא קופץ מ־30.0 ל־38.5, ובמבחן Humanity's Last Exam הוא מציג זינוק מ־15.9 ל־21.7. מנגד, ביכולות תכנות תחרותי טהור נרשמה ירידה מציון 2091 ל־2046 ב־Codeforces, כך שהדגש כאן הוא אוטומציה מעשית ולא פתרון חידות.

מתאים ל

  • סוכן בדיקות ותיקון קוד

    משיג 68.4 במבחן SWE Verified ומתאים לריצה בסביבות פיתוח מקומיות שדורשות אוטומציה.

  • סוכן חיפוש ואיסוף מידע

    ציון של 38.5 ב־BrowseComp מאפשר לו לתשאל דפדפן ולחלץ נתונים בצורה מדויקת מקודמו.

  • מערכות שאלות ותשובות

    תוצאה של 96.8 במבחן SimpleQA הופכת אותו למענה טוב עבור שליפת עובדות ללא הזיות מיותרות.

איפה זה נופל

בכרטיס המודל יש הודאה מפורשת על תקלה קיימת בבדיקת המשקלים. הפרמטרים בשכבת self_attn.o_proj אינם תואמים לפורמט הנתונים UE8M0 FP8, בעיה שהובטח לתקן רק בעתיד. מעבר לזה, במבחן BrowseComp-zh נרשמה ירידה מ־49.2 ל־45.0, וגם במבחני הקוד הטהור כמו Codeforces ו־Aider-Polyglot יש שחיקה קלה. יש לבדוק היטב את תקינות הפלטים בשכבות הקשב לפני שילוב שלו במערכות ייצור.

שאלות
נפוצות

האם כדאי להריץ את המודל על מחשב מקומי בודד?

לא, אלא אם יש לכם תחנת עבודה ייעודית עם זיכרון משותף ענק או כמה כרטיסי מסך חזקים במיוחד. הגרסה המומלצת ביותר שוקלת 247GB, מה שדורש חומרה יקרה בהרבה ממחשב שולחני רגיל.

למה יש צורך בדגל jinja בעת ההרצה?

המודל דורש את הדגל הזה כדי שמנוע llama.cpp יפרש נכון את תבנית השיחה המעודכנת של Unsloth. בלי הדגל הזה, הפורמט של ההוראות נשבר והתשובות מאבדות דיוק.

איך מריצים

כדי להריץ אותו דרך llama.cpp חובה להעביר את הדגל jinja, ולהגדיר טמפרטורה סביב 0.6 עם Top_P של 0.95. המפתחים ממליצים על גרסת UD-Q2_K_XL, אבל קחו בחשבון שרק הקובץ הזה שוקל 247GB. כלל המשקל במאגר מגיע ל־10TB עם 239 קבצים שונים.

מבחינת חומרה, מדובר במפלצת שמצריכה שרת עם מספר כרטיסי מסך מקצועיים בעלי זיכרון VRAM מאסיבי רק כדי לטעון את המשקלים הקלים. לרוב הפרויקטים יהיה זול ופשוט יותר לפנות ל־API, אלא אם אתם מחוייבים לריצה מקומית לחלוטין משיקולי אבטחה או רגולציה.

ollama run hf.co/unsloth/DeepSeek-V3.1-Terminus-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

239 קבצים במאגר, 10.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המאגר ומשקלי המודל משוחררים תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. אתם יכולים לשלב אותו במוצר מסחרי בלי דרישות לפתיחת קוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗