GPT
D

DeepSeek-R1-0528

קוד פתוח

deepseek-aimit2025-05-28

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • conversational

גרסת עדכון למודל החשיבה הענק שמכוונת לביצועי קוד ומתמטיקה ברמה הגבוהה ביותר. היא מיועדת למי שצריך יכולת הסקת מסקנות עמוקה ולא מוכן להתפשר על רישיון קוד פתוח מתירני.

  • 685Bפרמטרים
  • 163,840טוקנים בהקשר
  • 641 GBמשקל הקבצים
  • 218,142הורדות בחודש

מה זה

העדכון הזה מתמקד בהעמקת תהליך ההסקה של המודל באמצעות הקצאת משאבי חישוב נוספים בשלב האימון שלאחר מכן. הוא מתמודד עם משימות מורכבות על ידי הפקת שרשראות חשיבה ארוכות בהרבה, מה שמשפר ישירות תוצאות במתמטיקה ותכנות. בדירוג Codeforces Div1 הוא עולה מציון 1530 לציון 1930, ובמבחן SWE Verified לפתרון בעיות תוכנה הוא מגיע לפתרון של 57.6% מהמקרים לעומת 49.2% בגרסה הקודמת.

המשמעות של הזינוק בביצועים היא זמן תגובה ארוך יותר בפועל. בבדיקות AIME 2025 המודל מייצר בממוצע 23K טוקנים של מחשבה לכל שאלה לעומת 12K בעבר, כך שהדיוק עולה ל־87.5% אבל דורש סבלנות ומשאבים. בנוסף הוא כולל תמיכה מובנית ב־System Prompt בלי צורך לכפות תגיות חשיבה ידנית, וכולל יכולות משופרות לקריאות לפונקציות.

מתאים ל

  • פתרון בעיות מתמטיקה

    הוא מגיע ל־87.5% ב־AIME 2025 ומשקיע עשרות אלפי טוקנים בחשיבה לפני תשובה סופית.

  • פיתוח ותיקון באגים

    המודל פותר מעל 57% מהתקלות במבחן SWE Verified ומתאים לניתוח קוד מעמיק.

  • זיקוק מודלים קטנים

    הרישיון מאפשר לייצר שרשראות חשיבה כדי לאמן מודלים קומפקטיים וזולים יותר לארגון.

איפה זה נופל

למרות הקפיצה בלוגיקה, המודל רשם ירידה במבחן העובדות SimpleQA מציון 30.1 ל־27.8. זה מראה שהעמקת החשיבה לא הופכת אותו למאגר ידע אמין יותר כשמדובר בשאלות טריוויה או שליפת עובדות יבשות. בנוסף, יכולת העבודה שלו עם כלים עדיין מוגבלת, עם 37% בלבד במבחן BFCL הרב־שלבי, מה שמחייב בדיקה זהירה לפני שבונים עליו סוכנים אוטומטיים מורכבים.

שאלות
נפוצות

כמה זיכרון צריך כדי להריץ את המודל הזה עצמאית?

המשקלים דורשים מעל 640 גיגה בייט רק לאחסון וטעינה בסיסית בדיוק המקורי. להרצה חלקה של הקשר ארוך תצטרכו שרת עם 8 כרטיסי A100 או H100 של 80 גיגה בייט לפחות.

האם חייבים להזין תגית כדי להפעיל את החשיבה כמו בגרסה הקודמת?

לא. הגרסה הזו כבר תומכת בהגדרות מערכת רגילות ולא דורשת הזרקה של תגיות מחשבה בתחילת הפלט כדי להיכנס למצב פתרון בעיות.

איך מריצים

קבצי המודל שוקלים 641 גיגה בייט בפורמט bfloat16, מה שאומר שאי אפשר להריץ אותו על שרת בודד פשוט. תצטרכו קלאסטר של מספר כרטיסי שרת עם מאות גיגה בייטים של VRAM רק כדי לטעון אותו לזיכרון לפני שחישבתם טוקן אחד.

אם אין לכם תשתית ענן ייעודית ותקציב חומרה כבד, עדיף להשתמש ב־API התואם ל־OpenAI שהחברה מציעה או לבדוק את גרסת הזיקוק הקטנה של 8B שמבוססת על Qwen3 ורצה על חומרה נגישה בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-R1-0528")
print(pipe("שלום"))

הקבצים

174 קבצים במאגר, 641 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל והקוד מופצים תחת רישיון MIT. המשמעות היא חופש פעולה מוחלט, כולל שימוש מסחרי מלא, שינוי המשקלים, שילוב במוצרים מסחריים וזיקוק הידע למודלים קטנים יותר, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗