GPT
D

DeepSeek-V3.2-Speciale

קוד פתוח

deepseek-aimit2025-11-28

  • transformers
  • safetensors
  • deepseek_v32
  • text-generation
  • eval-results

גרסה עתירת חישוב של המודל הפתוח, שמיועדת להסקה מתמטית ולתכנות ברמה אולימפית. אתם תרצו אותה רק אם אתם צריכים ביצועי קצה באלגוריתמיקה ומסוגלים להחזיק משקל כזה בשרתים.

  • 685Bפרמטרים
  • 163,840טוקנים בהקשר
  • 642 GBמשקל הקבצים
  • 5,739הורדות בחודש

מה זה

הפרויקט הזה מביא ארכיטקטורה עם תשומת לב דלילה בשם DSA, שנועדה לחסוך משאבים בהקשרים ארוכים עד 163,840 טוקנים. הגרסה הספציפית הזו עברה הרחבה של חישוב האימון בחיזוקים, ולפי נתוני היצרן עוקפת את ביצועי GPT-5 ומגיעה לרמה של מדליית זהב באולימפיאדות המתמטיקה ומדעי המחשב של 2025.

בניגוד לגרסאות הרגילות בסדרה שכוללות שילוב כלים וסוכנים, הדגם הזה הוקרב לטובת כוח חשיבה טהור. הוא עובד בדיוק של bfloat16 על פני 61 שכבות, ובנוי סביב מבנה ענק של 685 מיליארד פרמטרים שמכוון כולו לפתרון בעיות סבוכות.

מתאים ל

  • פתרון בעיות אלגוריתמיות

    הוא הגיע להישגים של מדליית זהב ב־IOI ו־ICPC, ולכן מתאים לכתיבה וניתוח של אלגוריתמים מורכבים.

  • מחקר והוכחות במתמטיקה

    אימון החיזוקים הרחב מביא אותו לרמת זהב ב־IMO ומאפשר להתמודד עם הוכחות תיאורטיות קשות.

  • בדיקת גבולות מודלי חשיבה

    המשקל העצום וביצועי ההסקה החריגים הופכים אותו לבסיס טוב למחקר אקדמי על תהליכי מחשבה.

איפה זה נופל

החיסרון המרכזי מופיע שחור על גבי לבן בכרטיס המודל. הגרסה הזו לא תומכת בהפעלת כלים, כלומר אין יכולת של קריאה לפונקציות חיצוניות, חיפוש ברשת או הרצת קוד כחלק מתהליך המחשבה. בנוסף, אין קובץ תבנית שיחה בפורמט Jinja, וקוד הפיענוח שמצורף בגיטהאב לא מסוגל להתמודד עם פלטים משובשים, מה שמחייב אתכם לכתוב מנגנוני התאוששות שגיאות מאפס לפני שתעלו לפרודקשן.

שאלות
נפוצות

האם המודל הזה מתאים לפיתוח סוכן אוטומטי שמשתמש בכלים?

לא. היצרן ציין במפורש שהגרסה הזו מיועדת רק להסקה עמוקה ולא תומכת בשימוש בכלים או קריאות API חיצוניות.

כמה מקום בדיסק צריך כדי להוריד אותו?

המשקולות לבדן תופסות 642 ג'יגה בייט שמחולקים ל־192 קבצים, כך שתצטרכו נפח אחסון מהיר ומשמעותי עוד לפני חישובי הזיכרון להרצה.

האם יש תבנית שיחה מוכנה לעבודה עם ספריות כמו Transformers?

ההפצה לא כוללת תבנית Jinja סטנדרטית. תצטרכו להשתמש בסקריפטים של פייתון שפורסמו לצד המודל כדי לקודד את השיחות ולפענח את הפלטים.

איך מריצים

כדי להריץ 642 ג'יגה בייט של משקולות בפורמט מלא, תשכחו מחומרה ביתית או משרת בודד סטנדרטי. תצטרכו אשכול ייעודי של מספר כרטיסי H100 או A100 עם מאות ג'יגה בייט של זיכרון וידאו מהיר, רק כדי לטעון את 192 הקבצים לזיכרון לפני שהתחלתם לעבד טוקן אחד.

המפתחים ממליצים לעבוד עם פרמטרים של טמפרטורה 1.0 ו־top_p של 0.95. אם אין לכם גישה לחוות שרתים משלכם ותקציב חשמל של מתקן שלם, עדיף לחכות לגישה דרך שירות ענן או API מאשר להוריד את המשקל העצום הזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-V3.2-Speciale")
print(pipe("שלום"))

הקבצים

192 קבצים במאגר, 642 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט משוחרר תחת רישיון MIT. זה מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי קוד, הפצה וסגירת התוכנה במוצר פרטי. הדרישה היחידה היא לשמור את הקרדיט ואת נוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗