GPT
D

DeepSeek-V4-Pro-0813-GGUF

קוד פתוח

unslothmit2026-08-13

  • gguf
  • deepseek_v4
  • unsloth
  • deepseek
  • endpoints_compatible

גרסת GGUF למודל ענק עם 1.57 טריליון פרמטרים וחלון של מיליון טוקנים. פתרון מתאים למי שחייב מודל סוכנים ברמה הגבוהה ביותר על תשתית מקומית.

  • 1,048,576טוקנים בהקשר
  • 1.6 TBמשקל הקבצים
  • 137,420הורדות בחודש
  • 64לייקים

מה זה

מדובר במודל MoE עם 1.57 טריליון פרמטרים בסך הכול, שמפעיל 48 מיליארד פרמטרים לכל טוקן. המודל כולל רכיב פענוח ספקולטיבי בשם DSpark ומיועד למשימות תכנות וסוכנים אוטונומיים. חלון ההקשר מגיע למיליון טוקנים, 1,048,576 ליתר דיוק.

במבחני ביצועים הוא מציג זינוק חד מגרסת הפריוויו הקודמת. במבחן DeepSWE הוא עולה מציון של 12.8 לציון של 62.7, וב־NL2Repo הוא מגיע ל־61.5 לעומת 38.5 בעבר. במבחני מסוף כמו Terminal Bench 2.1 הוא עומד על 87.9, תוצאה שמציבה אותו ראש בראש מול מודלים קנייניים כבדים כמו Kimi K3 ו־Opus 4.8.

מתאים ל

  • סוכן תכנות במערכות סגורות

    מתאים לפתרון בעיות קוד מורכבות ומשימות מסוף בסביבה מקומית, עם ציון 87.9 במבחני טרמינל.

  • ניתוח מאגרי קוד מלאים

    חלון הקשר של מיליון טוקנים מאפשר להזין ספריות שלמות ומאגרי ענק בלי לקטוע את המידע.

  • אוטומציה של כלי עבודה

    מציג 74.1 במבחן Toolathlon ומסוגל להפעיל כלים חיצוניים באופן רציף במסגרת סוכנים.

איפה זה נופל

במבחן Agents Last Exam המודל נעצר על 25.7 בלבד, ובמבחן האוטומציה AutomationBench הוא מקבל 31.8. במשימות הקצה של עולם הסוכנים הוא עדיין מתקשה. בנוסף, במבחני פיתוח כמו DSBench הוא מקבל 71.1 ומפגר אחרי Fable 5 שהגיע ל־77.2.

מבחינת שילוב בקוד, אין כאן תבנית שיחה רגילה מסוג Jinja. כדי לעבוד איתו צריך להשתמש בסקריפטים ייעודיים מפייתון שמקודדים את ההודעות ומפענחים את הפלט, מה שדורש התאמה ידנית של צינור העבודה שלכם.

שאלות
נפוצות

אפשר להריץ את המודל על מחשב מקומי יחיד?

לא. משקל הקבצים עומד על 1.6 טרה בייט, והוא כולל מעל 1.5 טריליון פרמטרים. להרצה כזו נדרשת חוות שרתים עם כמות חריגה של זיכרון גרפי.

איך שולטים על זמן החשיבה של המודל?

הקידוד תומך בפרמטר reasoning effort בשלוש רמות: low, high ו־max. הרמה שנבחרה קובעת כמה שלבי חשיבה המודל יבצע לפני שהוא מחזיר תשובה.

האם יש צורך בהתאמות מיוחדות כדי לשלוח הודעות למודל?

כן, המודל לא מגיע עם תבנית צ'אט מובנית בפורמט Jinja. צריך להשתמש בסקריפט פייתון ייעודי מתוך תיקיית ההפצה כדי לקודד את הפרומפט ולפענח את התוצאה.

איך מריצים

נפח הקבצים הכולל הוא 1.6 טרה בייט שמחולקים ל־43 קבצים בדיוק bfloat16. כדי להחזיק משקל כזה בזיכרון צריך אשכול שרתים ייעודי עם נפח VRAM או RAM עצום, הרבה מעבר לתחנת עבודה בודדת. המפרסמים מציינים שהוא דורש משמעותית יותר זיכרון מגרסת Flash.

אם אין לכם מערך שרתים ארגוני עם עשרות כרטיסים מהירים, עדיף להשתמש ב־API של המודל. הרצה עצמית בפורמט הזה הגיונית רק בארגונים שלא יכולים להוציא מידע החוצה ומחזיקים את החומרה המתאימה.

ollama run hf.co/unsloth/DeepSeek-V4-Pro-0813-GGUF:Q8_K_XL

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

43 קבצים במאגר, 1.6 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT מלא על המאגר ועל המשקלים. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗