GPT
D

deepseek-v4-gguf

קוד פתוח

antirezmit2026-04-26

  • gguf
  • quantized
  • deepseek
  • deepseek-v4
  • deepseek-v4-flash

גרסת קוונטיזציה מיוחדת של DeepSeek V4 Flash שנבנתה עבור מנוע ההרצה ds4. היא דוחסת את המומחים כדי לאפשר הרצה מקומית על תחנות עבודה חזקות.

  • 3.4 TBמשקל הקבצים
  • 2,088,647הורדות בחודש
  • 468לייקים

מה זה

המאגר הזה מציע קבצי GGUF מותאמים אישית למנוע ds4 של antirez. הרעיון המרכזי בכימות כאן הוא חלוקה לא סימטרית. המומחים המנותבים נדחסו חזק מאוד לרמות של IQ2 או Q4, בזמן שחלקי הליבה כמו מנגנון הקשב, הראוטר והמומחים המשותפים נשארו בדיוק גבוה של שמונה ביט או נקודה צפה. זה שומר על יכולת קבלת ההחלטות של המודל ומצמצם בחדות את נפח הזיכרון הכולל.

מבחינת ייעוד, הקבצים מכוונים למשימות של יצירת טקסט ושיחה באנגלית. במקום לנסות לדחוס את כל המשקלים באותה צורה, החלוקה הזו מנצלת את ארכיטקטורת המומחים כדי שכל טוקן יפעיל רק חלק קטן מהמודל בלי לפגוע בשכבות התשתית הקריטיות.

מתאים ל

  • שרת שיחה מקומי פרטי

    הרצה מקומית בתוך רשת סגורה על גבי שרת ds4 עם הקשר רחב וללא תלות ברשת חיצונית.

  • הסקה מהירה על מק 128GB

    גרסת ה־q2 נכנסת במלואה לתחנת עבודה תואמת ומאפשרת עבודה מקומית ישירה.

  • בדיקות פענוח ספקולטיבי

    קובץ ה־MTP מאפשר לבחון האצת זמני תגובה ביצירת טקסט באמצעות מנוע ds4.

איפה זה נופל

הקבצים הותאמו ספציפית למנוע ds4 ולא בהכרח יעבדו כמו שצריך במנועי GGUF סטנדרטיים אחרים, במיוחד מודל ה־MTP שדורש מנגנון טעינה ייעודי. בנוסף, המודל מוגדר רשמית לשפה האנגלית בלבד, כך שלא כדאי לבנות עליו לפרויקטים בעברית לפני בדיקה יסודית. דחיסת המומחים ל־IQ2 עלולה גם להפגין ירידה באיכות התוצאות במשימות מורכבות ביחס למשקלים המקוריים.

שאלות
נפוצות

האם אפשר להריץ את הקבצים האלה בתוכנות צד שלישי רגילות כמו llama.cpp?

הכרטיס מציין שהקבצים הותאמו במיוחד למנוע ds4. חלקם אולי יעבדו במנועים אחרים, אבל מודל ה־MTP דורש תמיכה מיוחדת ולא יעבוד ללא המנוע המתאים.

מה ההבדל המעשי בין גרסת ה־q2 לגרסת ה־q4?

גרסת ה־q2 דוחסת את המומחים המנותבים בצורה אגרסיבית יותר ומסתפקת ב־128 גיגה זיכרון, בעוד גרסת ה־q4 שומרת עליהם באיכות גבוהה יותר אך דורשת לפחות 256 גיגה זיכרון.

איך מריצים

כדי להריץ את גרסת ה־q2 צריך מחשב עם 128 גיגה זיכרון, למשל מחשבי מק תואמים, והקובץ עצמו שוקל 80.8 גיגה. גרסת ה־q4 דורשת לפחות 256 גיגה זיכרון ושוקלת 153.3 גיגה. בנוסף קיים קובץ MTP במשקל 3.6 גיגה שמיועד להאצת הדגימה בשיטת פענוח ספקולטיבי.

ההפעלה דורשת הידור מקומי של מנוע ds4 מגיטהאב והרצה ישירה דרכו, כולל אפשרות לשרת מקומי שתומך בהקשר של 100 אלף טוקנים וכתיבת זיכרון לדיסק. אם אין לכם תחנת קצה עם 128 או 256 גיגה זיכרון פנוי, אין טעם לנסות להריץ מקומית ועדיף לפנות ישירות ל־API מרוחק.

ollama run hf.co/antirez/deepseek-v4-gguf:Q2KDOWN

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

25 קבצים במאגר, 3.4 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי, הפצה ושילוב במוצרים סגורים כמעט ללא הגבלות, למעט שמירה על הודעת זכויות היוצרים. זכויות הבסיס שייכות ל־DeepSeek והקבצים מופצים לפי תנאי מודל המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗