GPT
D

DeepSeek-V3-GGUF

קוד פתוח

unslothmit2025-01-06

  • transformers
  • gguf
  • deepseek_v3
  • deepseek
  • unsloth

גרסאות מכווצות בפורמט GGUF למודל הענק של דיפסיק. הן מאפשרות לנסות להריץ מודל של 671 מיליארד פרמטרים על חומרה מקומית נגישה יותר דרך כלי llama.cpp.

  • 2.7 TBמשקל הקבצים
  • 1,044הורדות בחודש
  • 138לייקים

מה זה

מדובר בהמרה של מודל מומחים ענק עם 671 מיליארד פרמטרים בסך הכל, שמתוכם 37 מיליארד פעילים בכל טוקן. הדף הזה מרכז גרסאות מכווצות של המודל, מגרסה דחוסה במיוחד ועד גרסאות ששומרות על דיוק גבוה. המודל הבסיסי מציג ביצועים גבוהים מאוד במבחני קוד ומתמטיקה, עם תוצאות כמו 65.2 אחוז במבחן התכנות HumanEval וציון של 89.3 אחוז במבחן המתמטיקה GSM8K, לצד חלון הקשר של 128 אלף טוקנים.

היתרון בארכיטקטורת המומחים הוא שמחשבים רק חלק קטן מהרשת בכל רגע, מה שמקל על שלב החישוב. למרות זאת, עדיין צריך להחזיק את כל המשקלים בזיכרון. הגרסאות האלו מיועדות ספציפית למי שרוצה לעבוד דרך llama.cpp ומחפש דרך מעשית לדחוס את המודל לזיכרון הקיים אצלו במקום להחזיק חוות שרתים.

מתאים ל

  • מחקר מקומי של מודלים ענקיים

    ניתוח התנהגות של מודל מומחים ענק בסביבה סגורה בלי תלות ברשת.

  • פיתוח כלי קוד מקומיים

    מנוע להשלמת קוד בארגונים עם דרישות אבטחה קפדניות שלא מאפשרות API.

  • בדיקות כיווץ והרצה

    בחינת יכולות הסריאל והתמודדות של llama.cpp עם מודלים מעל 600B.

איפה זה נופל

הבעיה המרכזית כאן היא הנפח הפיזי. גם הגרסה הכי מכווצת שוקלת מעל 200 גיגה בייט, ופריקה של חמש שכבות בלבד לכרטיס מסך ביתי תגרום לקצב ייצור טוקנים אטי מאוד שאינו מתאים למוצר בזמן אמת. בנוסף, בספריית transformers הרגילה המודל עדיין לא נתמך ישירות לפי התיעוד, ויש להקפיד על הגדרות מדויקות של זיכרון המטמון בגלל שחלק מהפורמטים פשוט לא עובדים.

אותה משפחה

DeepSeek יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי בודד?

לא באופן מלא. כרטיס של 24 גיגה בייט מאפשר לפרוק רק חמש שכבות מתוך הגרסה הכי קלה, כך שרוב החישוב ירוץ על המעבד והזיכרון הראשי ויהיה אטי מאוד.

באילו שפות המודל תומך לפי הנתונים?

הנתונים הרשמיים בעמוד מציינים אנגלית בלבד, אם כי במבחני הביצועים נבדקו גם משימות בסינית ומבחנים רב לשוניים.

איך מריצים

המשקלים בפורמט הזה דורשים שטח אחסון עצום שנע בין 207 גיגה בייט לגרסה הכי מכווצת, ועד 712 גיגה בייט לגרסת שמונה ביט. לפי התיעוד, את הגרסה הקלה ביותר אפשר להריץ עם שילוב של זיכרון מעבד וכרטיס מסך בנפח כולל של סביב 40 גיגה בייט, כאשר כרטיס בודד כמו RTX 4090 עם 24 גיגה בייט מאפשר לפרוק אליו חמש שכבות בלבד.

מריצים את הקבצים דרך llama-cli עם תמיכה במטמון מסוג K בלבד, תוך שימוש בתבנית השיחה המקורית של המודל. אם אין לכם מאגר זיכרון מהיר בנפח של מאות גיגה בייטים ומספר מעבדים גרפיים, הריצה המקומית תהיה אטית להחריד, וברוב המקרים עדיף להשתמש בגישה לממשק הקיים של דיפסיק.

ollama run hf.co/unsloth/DeepSeek-V3-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

66 קבצים במאגר, 2.7 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המאגר מציג רישיון מסוג MIT, אך התיעוד מציין ששימוש במודל עצמו כפוף לתנאי הרישיון הייעודי של דיפסיק. שני המקורות מאשרים שימוש מסחרי מלא, כך שמותר לשלב את המשקלים במערכות מסחריות בכפוף להוראות המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗