GPT
D

DeepSeek-R1

קוד פתוח

deepseek-aimit2025-01-20

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • conversational

מודל הסקת מסקנות בקוד פתוח שמתחרה ישירות בביצועים של מודלים סגורים וחזקים במתמטיקה ותכנות. הוא פותר בעיות מורכבות בעזרת שרשרת חשיבה ארוכה.

  • 684Bפרמטרים
  • 163,840טוקנים בהקשר
  • 641 GBמשקל הקבצים
  • 776,744הורדות בחודש

מה זה

מדובר במודל מבוסס תערובת מומחים שמאמן את עצמו לחשוב לפני שהוא עונה. בניגוד לגרסת האפס שלו שסבלה מחזרתיות ומבליל שפות, כאן שילבו דאטה ייעודי בתחילת הדרך כדי לייצב את התוצאות, ואז הפעילו למידת חיזוק שמעודדת בדיקה עצמית ותיקון טעויות תוך כדי ריצה.

במבחני ביצועים קשים הוא מראה תוצאות חריגות למודל פתוח. במתמטיקה הוא השיג 79.8 אחוזים ב־AIME 2024 ו־97.3 אחוזים ב־MATH-500, מה שמציב אותו כתף אל כתף מול מודלים סגורים כמו o1. גם בתכנות תחרותי הוא הגיע לאחוזון 96.3 ב־Codeforces. זה אומר שבמקום לנחש את המילה הבאה, הוא מייצר תהליך מחשבתי שלם שמפרק בעיות כבדות לחלקים קטנים.

מתאים ל

  • פתרון בעיות מתמטיקה

    הוא מגיע לדיוק של מעל 97 אחוזים במבחני מתמטיקה מתקדמים בזכות שרשרת חשיבה ובדיקה עצמית.

  • כתיבת אלגוריתמים מורכבים

    מתאים למשימות קוד תחרותיות שדורשות פירוק לוגי מעמיק לפני כתיבת שורת הקוד הראשונה.

  • זיכוך מודלים קטנים

    הרישיון והיכולות מאפשרים לייצר ממנו דאטה איכותי כדי לאמן מודלים פנימיים וזולים בהרבה.

איפה זה נופל

המודל דורש הקפדה מחמירה על הפרומפט. המפתחים מזהירים מראש שלא להשתמש ב־system prompt, אחרת הביצועים נפגעים, והטמפרטורה חייבת להישאר בטווח של 0.5 עד 0.7 כדי למנוע ממנו להיכנס ללולאות אינסופיות. בנוסף, יש לו נטייה לדלג על שלב החשיבה בשאלות מסוימות, מה שמחייב לכפות עליו להתחיל את התשובה עם תגית חשיבה כדי לקבל תוצאה טובה.

שאלות
נפוצות

אפשר להריץ אותו על שרת יחיד במשרד?

לא. מדובר במודל ענק ששוקל 641 גיגה בייט ומחזיק 671 מיליארד פרמטרים. להרצה מקומית תצטרכו קלאסטר שלם של מאיצים גרפיים חזקים, ולכן לרוב השימושים עדיף לקרוא לו דרך API.

האם הוא יודע לענות מיד בלי לחשוב?

הוא בנוי במפורש לייצר שרשרת חשיבה ארוכה לפני התשובה הסופית. אם תנסו לעקוף את זה או לבטל את שלב החשיבה, איכות הפתרון שלו תרד משמעותית.

איך מריצים

כדי להריץ את המודל המלא עם כל 671 מיליארד הפרמטרים ומשקל קבצים של 641 גיגה בייט, אתם צריכים אשכול שרתים ייעודי ומרובה כרטיסי מסך חזקים. מעבר לדרישות החומרה העצומות, ספריית transformers עדיין לא נתמכת כאן ישירות להרצה מקומית, וצריך להשתמש בכלים ובסביבות שמתאימים לארכיטקטורה שלו.

אם אין לכם תשתית ענן ארגונית עם תקציב משמעותי, עדיף בהרבה לפנות ל־API שלו או לבחור באחת מגרסאות הזיכוך הקטנות יותר, שנעות בין מיליארד וחצי ל־70 מיליארד פרמטרים ורצות בקלות על שרתים בודדים.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-R1")
print(pipe("שלום"))

הקבצים

174 קבצים במאגר, 641 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT מלא. אפשר לקחת את המשקלים ואת הקוד, לשלב אותם במוצר מסחרי, לשנות אותם ואפילו לזקק מהם מודלים קטנים יותר לאימון עצמאי בלי הגבלות שימוש, כל עוד שומרים על תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗