GPT
D

DeepSeek-V3-0324-GGUF

קוד פתוח

unslothmit2025-03-25

  • transformers
  • gguf
  • deepseek_v3
  • text-generation
  • deepseek

גרסה מכווצת של עדכון מרץ למודל הדגל מבית דיפסיק, שמציעה חשיבה וקידוד ברמה גבוהה. היא מיועדת למי שחייב להריץ מודל ענק מקומית בכלים כמו llama.cpp.

  • 163,840טוקנים בהקשר
  • 5.1 TBמשקל הקבצים
  • 12,358הורדות בחודש
  • 200לייקים

מה זה

מדובר בגרסת GGUF דינמית ששחררה unsloth לעדכון של דיפסיק ממרץ 2025. השינוי המרכזי בעדכון הזה נוגע ליכולות חשיבה ומתמטיקה. במבחן AIME המודל קפץ מציון של 39.6 לציון 59.4, ובמבחן LiveCodeBench עלה מ־39.2 ל־49.2, כך שרואים שיפור ניכר בייצור קוד שעובר טסטים ובפתרון בעיות סבוכות. מעבר לזה המפתחים תיקנו כאן באגים בהפעלת פונקציות ושיפרו פיתוח צד לקוח לווב.

הייחוד בחבילה של unsloth הוא בכימות הדינמי. במקום לכווץ את כל השכבות באותה צורה, הם שמרו על רמת דיוק גבוהה יותר בחלקים קריטיים של מנגנון המומחים, מה שמונע את ההידרדרות החדה בביצועים שמאפיינת בדרך כלל כימות של מתחת ל־3 ביט.

מתאים ל

  • פיתוח ממשקי ווב

    המודל כולל שיפור מובנה לכתיבת קוד צד לקוח אסתטי ויציב יותר מקודמו.

  • הפעלת כלים ופונקציות

    תיקוני ארכיטקטורה בעדכון מרץ שיפרו את הדיוק בזיהוי והרצת function calling.

  • פתרון בעיות קוד מורכבות

    הקפיצה לציון 49.2 ב־LiveCodeBench מבטיחה יכולת טובה יותר באלגוריתמיקה.

איפה זה נופל

גרסאות הכימות הנמוכות ביותר של 1.78 ביט ו־1.93 ביט מוגדרות מראש כניסיוניות. הן מייצרות לעיתים קוד שבור ואינן מומלצות לשימוש שוטף. בנוסף, נכון לפרסום, ספריית transformers של Hugging Face אינה תומכת במודל הזה באופן ישיר. בעיה נוספת היא הטמפרטורה, המודל כויל לעבוד בטמפרטורה נמוכה של 0.3, ושימוש בטמפרטורת ברירת מחדל רגילה יוביל לפלט לא יציב.

שאלות
נפוצות

איזו גרסת כימות כדאי להוריד?

עדיף לכוון לגרסת 2.71 ביט ששוקלת 248 גיגה בייט או ל־2.42 ביט ששוקלת 219 גיגה בייט. שתיהן נבדקו ונמצאו מאוזנות בין נפח ליכולת כתיבת קוד. הגרסאות שמתחת ל־2 ביט עדיין בוסריות ונוטות לייצר שגיאות.

האם אפשר להריץ אותו דרך ספריית transformers?

כרגע לא. כרטיס המודל מציין מפורשות שאין תמיכה ישירה ב־transformers. השימוש מיועד לתוכנות ומנועים שמבוססים על ספריית llama.cpp כמו LMStudio או שרת ייעודי.

למה התשובות יוצאות מבולבלות בהרצה עצמאית?

המודל מתוכנן לעבוד בטמפרטורה פנימית של 0.3. אם מריצים אותו עם טמפרטורה ברירת מחדל של 1.0 מבלי לכייל את ההגדרות, הוא נוטה לאבד עקביות ולייצר תשובות פחות איכותיות.

איך מריצים

המודל דורש לפחות 180 גיגה בייט של זיכרון משולב של כרטיסי מסך וראם כדי לעלות. הקבצים נעים בין 186 גיגה בייט בגרסה הרזה ביותר ועד 405 גיגה בייט לגרסת 4.5 ביט. מפתחי unsloth ממליצים במפורש על גרסאות 2.42 ביט בנפח 219 גיגה או 2.71 ביט בנפח 248 גיגה, משום שהן עברו בהצלחה את כל מבחני הקוד שלהם.

אתם מריצים את הקבצים הללו דרך מנועים מבוססי llama.cpp, למשל LMStudio או Open WebUI. אם אין לכם תחנת עבודה ייעודית מרובת כרטיסים או שרת עתיר זיכרון, אין שום הגיון כלכלי לנסות להרים את זה לבד, ופשוט עדיף לשלם לפי טוקן ב־API.

ollama run hf.co/unsloth/DeepSeek-V3-0324-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

126 קבצים במאגר, 5.1 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. המשמעות היא שאתם רשאים לעשות איתו הכל, כולל שימוש מסחרי מלא, הטמעה במוצר סגור ושינוי המשקלים, בלי לשלם תמלוגים. הדרישה היחידה היא לשמור את הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗