GPT
D

DeepSeek-V3.2-Exp

קוד פתוח

deepseek-aimit2025-09-29

  • transformers
  • safetensors
  • deepseek_v32
  • text-generation
  • conversational

גרסה ניסיונית ענקית שמביאה מנגנון קשב דליל לשיפור מהירות בהקשרים ארוכים. המודל שומר על ביצועי הסדרה הקודמת עם יעילות משופרת בחישוב.

  • 685Bפרמטרים
  • 163,840טוקנים בהקשר
  • 642 GBמשקל הקבצים
  • 60,099הורדות בחודש

מה זה

מדובר במודל שנועד לבחון את מנגנון DeepSeek Sparse Attention כשלב ביניים לארכיטקטורה הבאה. המטרה המרכזית כאן היא שיפור זמני האימון וההסקה בטקסטים ארוכים בלי לאבד מאיכות הפלט. לפי המדידות, הוא שומר על קו כמעט זהה לדגם V3.1-Terminus, כולל 85.0 במבחן MMLU-Pro וציון 67.8 ב־SWE Verified לעומת 68.4 בדגם הקודם.

הוא מיועד למשימות הסקה מורכבות, כתיבת קוד והפעלת כלים חיצוניים במצב סוכן, כפי שרואים בתוצאה של 97.1 ב־SimpleQA וציון מדורג של 2121 ב־Codeforces. החידוש אינו קפיצה חדה באינטליגנציה, אלא היכולת להשיג את אותה רמה גבוהה בפחות משאבי חישוב כשהקלט ארוך במיוחד.

מתאים ל

  • ניתוח מסמכי ענק

    חלון של 163,840 טוקנים בשילוב קשב דליל מאפשר עיבוד חוזים וספריות קוד שלמות ביעילות גבוהה.

  • פתרון בעיות תכנות

    תוצאה של 2121 ב־Codeforces מראה יכולת חזקה במיוחד באלגוריתמיקה וכתיבת קוד מורכב.

  • סוכנים אוטונומיים

    שילוב ביצועים יציב במבחני BrowseComp ושימוש בכלים מתאים למערכות שדורשות פעולות דפדפן ומסוף.

איפה זה נופל

זהו דגם ניסיוני מוצהר, וככזה הוא נושא סיכוני יציבות. בעדכון שפורסם התגלתה תקלה במימוש ה־RoPE במודול האינדקס שפגעה בביצועים עד שתוקנה בקוד ההסקה. בנוסף, במבחנים קשים כמו Humanity's Last Exam הוא ירד מ־21.7 ל־19.8, וב־GPQA ירד ל־79.9. המנגנון הדליל עלול להציג התנהגות שונה במקרי קצה, ולכן חובה לבדוק תאימות מלאה לספריות שלכם לפני שמסתמכים עליו.

אותה משפחה

DeepSeek-V3.2-Exp יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם כרטיס GPU בודד?

לא, אין שום אפשרות כזו. המודל שוקל 642 ג'יגה בייט בפורמט bfloat16 ומחזיק 685 מיליארד פרמטרים. תצטרכו מערך מרובה כרטיסים כמו שמונה כרטיסי H200 לפחות כדי לטעון אותו לזיכרון.

האם כדאי להחליף את V3.1 במודל הזה בסביבת ייצור?

לא כדאי למהר. היצרן מגדיר אותו כגרסה ניסיונית לבדיקת יעילות, ולא כדגם דגל יציב. עדיף להמתין שהארכיטקטורה תתייצב או לבדוק אותו היטב בסביבת פיתוח.

איך מריצים

כדי להריץ מודל במשקל 642 ג'יגה בייט עם 685 מיליארד פרמטרים, צריך אשכול שרתים רציני. ההוראות של החברה כוללות שימוש ב־SGLang עם שמונה ערוצי Tensor Parallel ושמונה Data Parallel, או שימוש ב־vLLM. יש תמיכה במעבדי H200, כרטיסי MI350 וכן מעבדי NPU ייעודיים.

עבור רוב המפתחים והצוותים הקטנים, אין שום היגיון להרים מפלצת כזו בבית או בענן עצמאי. עלויות החומרה והתחזוקה עצומות, וקריאה ל־API תהיה זולה ופשוטה בהרבה אלא אם אתם מחויבים לפרטיות מוחלטת של הנתונים ברמת התשתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V3.2-Exp")
print(pipe("שלום"))

הקבצים

180 קבצים במאגר, 642 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון כאן הוא MIT מלא ופתוח, גם לקוד וגם למשקולות. מותר להשתמש בו לצרכים מסחריים, לשנות, להפיץ ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗