GPT
D

DeepSeek-V3.1-GGUF

קוד פתוח

unslothmit2025-08-21

  • transformers
  • gguf
  • deepseek
  • deepseek_v3
  • unsloth

גרסת קוונטיזציה של מודל ענק עם 671 מיליארד פרמטרים, שמשלב מצב חשיבה רגיל ומעמיק באותו קובץ. הוא מיועד למי שרוצה ביצועים ברמת הדגל בהרצה עצמית דרך llama.cpp.

  • 10.1 TBמשקל הקבצים
  • 2,067הורדות בחודש
  • 98לייקים

מה זה

מדובר במודל שכולל 671 מיליארד פרמטרים בסך הכול, אך מפעיל רק 37 מיליארד בכל טוקן בזכות ארכיטקטורת תערובת מומחים. השינוי המרכזי בגרסה הזו הוא היכולת לעבור בין מצב חשיבה מעמיק למצב רגיל דרך תבנית השיחה בלבד, בלי לטעון משקלים נפרדים. הוא תומך בהקשר של עד 128 אלף טוקנים ועבר הרחבת אימון ייעודית למסמכים ארוכים.

במדדי קוד וסוכנים, הדגם מציג שיפור ניכר. גרסת החשיבה מגיעה לציון 74.8 במבחן LiveCodeBench ולדירוג 2091 ב־Codeforces, לעומת ביצועים נמוכים יותר בגרסה הקודמת. בבדיקת Dynamic 3-bit של המפרסמים ב־Aider Polyglot נרשם ציון של 75.6 אחוזים, ובמצב סוכן הוא מגיע ל־66 אחוזים ב־SWE Verified. הנתונים מראים שמצב החשיבה כאן מהיר יותר מגרסאות עבר ומספק תוצאות דומות בפתרון בעיות מתמטיקה ותכנות מורכבות.

מתאים ל

  • סוכני תכנות מורכבים

    הוא מגיע ל־66 אחוזים ב־SWE Verified ומציע מבנה קריאות כלים מוגדר היטב לטיפול במאגרי קוד.

  • פתרון בעיות מתמטיות

    מצב החשיבה רושם 93.1 אחוזים ב־AIME 2024 ומספק מענה מדויק לשאלות חישוביות עמוקות.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 128 אלף טוקנים שאומן על מיליארדי טוקנים ייעודיים מתאים לעיבוד טקסטים כבדים.

איפה זה נופל

למרות השדרוג ביכולות ההיגיון, במבחן Humanity's Last Exam המודל נעצר על 15.9 אחוזים בלבד ללא כלים חיצוניים, וגם עם חיפוש ופייתון הוא מגיע ל־29.8 אחוזים. מעבר לכך, כל בדיקות סוכני החיפוש והקוד של המפתחים הסתמכו על מסגרות עבודה פנימיות וכלים מסחריים סגורים שלא כלולים בקבצים, ולכן ביצועי הסוכנים אצלכם יהיו תלויים לחלוטין במערכת החיצונית שתבנו סביבו. במצב ללא חשיבה, הביצועים במתמטיקה יורדים משמעותית, למשל 49.8 אחוזים ב־AIME 2025 לעומת 88.4 במצב המלא.

אותה משפחה

DeepSeek יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את כל המאגר ששוקל מעל 10 טרה בייט?

אין צורך להוריד את כל המאגר. הוא מכיל עשרות גרסאות קוונטיזציה שונות ברמות דחיסה מגוונות. עליכם לבחור רק את הקובץ שמתאים למגבלות הזיכרון שלכם, למשל גרסת UD-Q2_K_XL המומלצת ששוקלת 247 גיגה בייט.

איך עוברים בין מצב חשיבה מעמיק למצב שיחה רגיל?

המעבר מתבצע רק דרך עיצוב הפרומפט בתבנית השיחה. הוספת תגית הסיום think סוגרת את שלב המחשבה ומחזירה תשובה מהירה, בעוד שהשארת תגית הפתיחה מאלצת את המודל לבצע תהליך חשיבה מפורט לפני המענה.

איך מריצים

ההרצה המקומית נעשית דרך llama.cpp או ספריות תומכות ומחייבת שימוש בדגל jinja עבור תבנית השיחה. המפרסמים ממליצים על טמפרטורה של 0.6 וערך טופ פי של 0.95, כשהגרסה המומלצת מביניהן היא UD-Q2_K_XL ששוקלת לבדה 247 גיגה בייט. מאגר הקבצים כולו שוקל 10.1 טרה בייט ומחולק לעשרות גרסאות קוונטיזציה שונות.

כדי להחזיק משקל כזה בזיכרון תצטרכו שרת עם מאות גיגה בייט של זיכרון גרפי מאוחד או מעבדים גרפיים מקצועיים רבים. אם אין לכם חומרה ייעודית בקנה מידה של מרכז נתונים, פנייה לשירות ענן או קריאה ל־API חיצוני תהיה זולה ומעשית בהרבה מהרצה עצמית.

ollama run hf.co/unsloth/DeepSeek-V3.1-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

241 קבצים במאגר, 10.1 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא MIT, שמאפשר שימוש מסחרי, שינוי קוד, הפצה ושילוב במוצרים סגורים בלי תשלום תמלוגים. הדרישה העיקרית היא שמירת הודעת זכויות היוצרים והרישיון המקורי. המשמעות היא שאתם רשאים לשלב את המשקלים או להציע שירותים המבוססים עליהם בכל פרויקט עסקי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗