GPT
D

DeepSeek-Math-V2

קוד פתוח

deepseek-aiapache-2.02025-11-27

  • transformers
  • safetensors
  • deepseek_v32
  • text-generation
  • conversational

מפלצת של 685 מיליארד פרמטרים שמיועדת להוכחת משפטים מתמטיים מורכבים ברמת אולימפיאדה. הוא בודק את שלבי ההוכחה של עצמו במקום רק לנחש תשובה סופית.

  • 685Bפרמטרים
  • 163,840טוקנים בהקשר
  • 642 GBמשקל הקבצים
  • 693הורדות בחודש

מה זה

הפיתוח כאן מתמקד בבעיה מוכרת של מודלי שפה, הם מנחשים תוצאה נכונה אבל מחרטטים את הדרך. במקום לחלק ציונים רק לפי מספר סופי, אימנו כאן מודל אימות שבודק צעד אחרי צעד את ההיגיון הלוגי, והמודל הראשי לומד לתקן את עצמו תוך כדי ריצה.

התוצאות בכרטיס מציגות ביצועים חריגים בתחרויות מתמטיקה אקדמיות ובינלאומיות, כולל רמת מדליית זהב ב־IMO 2025 וציון של 118 מתוך 120 ב־Putnam 2024. ההישג הזה מבוסס על הגדלת כוח החישוב בזמן הסקה, מה שאומר שהוא מקדיש זמן לחשוב, לפסול כיוונים שגויים ולאמת את הטיעונים לפני פליטת הפתרון.

מתאים ל

  • פתרון בעיות באולימפיאדות

    המודל פותר שאלות מורכבות מתחרויות כמו IMO ו־Putnam הודות ליכולת הסקה ממושכת ובדיקת נכונות עצמית.

  • אימות הוכחות מתמטיות

    בדיקת לוגיקה צעד אחר צעד במאמרים אקדמיים במקום להסתמך על בדיקת תשובות מספריות בלבד.

  • מחקר על הסקה בזמן בדיקה

    בסיס מצוין לחוקרים שרוצים לבחון שיטות אימון שמשלבות מודל אימות ומודל יצירה בארכיטקטורות ענק.

איפה זה נופל

זה כלי מחקרי ממוקד מאוד. הוא נבנה עבור הוכחות מתמטיות טהורות וקפדניות, ולא כדי לכתוב קוד לאתר, לתרגם טקסטים או לנהל שיחה חופשית. חלון ההקשר אמנם עומד על 163,840 טוקנים, אבל צריכת הזיכרון בעומק כזה עם מודל בסדר גודל כזה היא קיצונית. בנוסף, מנגנון האימות העצמי נשען על הרחבת חישוב בזמן בדיקה, כך שהסקה של בעיה בודדת עשויה לקחת זמן רב ולעלות המון כסף.

אותה משפחה

DeepSeek-Math יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ אותו על שרת GPU יחיד?

לא. המשקלים תופסים 642 גיגה בייט בקבצים הגולמיים, ולפני חישובי הקשר צריך מעל 700 גיגה בייט של זיכרון וידאו נקי רק כדי לטעון אותו. תצטרכו מערך מרובה כרטיסי 80GB כדי להתחיל לעבוד.

הוא מתאים למשימות פיתוח תוכנה או שיחה כללית?

הוא אומן והותאם ספציפית להוכחות מתמטיות ולהסקה פורמלית תחת מודל אימות ייעודי. לשימושי קוד, כתיבה או צ'אט כללי עדיף להשתמש במודלי בסיס רחבים ולא בגרסה הזו.

איך מריצים

להריץ 685 מיליארד פרמטרים בפורמט bfloat16 דורש תשתית שאין בשום מחשב משרדי או שרת בודד פשוט. קבצי המשקלים לבדם שוקלים 642 גיגה בייט, כך שצריך אשכול שרתים רציני עם כמה כרטיסי H100 או A100 בעלי זיכרון גבוה רק כדי לטעון אותו ל־VRAM.

המודל מבוסס על ארכיטקטורת DeepseekV32ForCausalLM ונתמך בספריית transformers, כשההוראות מפנות למאגר הניסיוני של DeepSeek-V3.2. אם אין לכם גישה לאשכול שרתים ייעודי ותקציב חשמל של חברה גדולה, עדיף להמתין לממשק API או לגרסאות מכווצות מבוססות קוונטיזציה.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-Math-V2")
print(pipe("שלום"))

הקבצים

179 קבצים במאגר, 642 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון Apache 2.0 פתוח ומתיר שימוש מסחרי ומחקרי מלא, כולל שינוי של המשקלים והפצה מחדש. אין כאן הגבלות שימוש מעורפלות, ואתם יכולים לשלב אותו במוצרים פנימיים או חיצוניים כל עוד אתם מצרפים עותק של הרישיון וקרדיט למפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗