GPT
D

DeepSeek-R1-Distill-Qwen-7B

קוד פתוח

deepseek-aimit2025-01-20

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

זהו שילוב בין הבסיס של Qwen לחשיבה המזוקקת של מודל הדגל מבית DeepSeek. מקבלים יכולות מתמטיקה וקוד של מודל ענק, אבל בחבילה קומפקטית של 7.6 מיליארד פרמטרים.

  • 7.6Bפרמטרים
  • 131,072טוקנים בהקשר
  • 14.2 GBמשקל הקבצים
  • 359,661הורדות בחודש

מה זה

מדובר במודל צפוף המבוסס במקור על Qwen2.5-Math-7B, שעבר אימון עדין על 800 אלף דוגמאות חשיבה שנוצרו על ידי DeepSeek-R1 הגדול. המטרה היא להעתיק דפוסי חשיבה, בדיקה עצמית והסקה לוגית ארוכה אל תוך משקל קל משמעותית.

במבחני ביצועים הוא מציג מספרים יוצאי דופן לגודל שלו. במבחן AIME 2024 הוא מגיע לציון pass@1 של 55.5, ובמבחן MATH-500 הוא מגיע ל־92.8, שזה גבוה ממה שמציגים מודלים סגורים כמו GPT-4o או Claude 3.5 Sonnet בגרסאות שנבדקו. בקוד הוא מגיע ל־37.6 במבחן LiveCodeBench ודירוג 1189 ב־CodeForces. התוצאות האלו ממחישות שהזיקוק עבד מעולה על פתרון בעיות מוגדרות היטב.

מתאים ל

  • פתרון בעיות מתמטיקה

    מציג 92.8 במבחן MATH-500 ומתעלה במשימות חישוב והסקה על מודלים מסחריים כבדים בהרבה.

  • כתיבת אלגוריתמים

    משלב יכולת חשיבה בשלבים שמאפשרת לו לתכנן ולממש קוד בצורה מדויקת מקומית.

  • עיבוד מקומי ופרטי

    רץ בשלמותו על כרטיס מסך בודד של 16GB ללא צורך בשליחת נתונים רגישים החוצה.

איפה זה נופל

המודל מציג חולשה מובנית ברגע שמשנים לו את הרגלי העבודה. אסור להגדיר לו הנחיית מערכת (system prompt), וכל ההוראות חייבות להופיע בתוך פניית המשתמש בלבד. טמפרטורת הריצה מוגבלת מאוד ומומלצת סביב 0.6, אחרת הוא נוטה לחזרתיות בלתי פוסקת או לפלט מקוטע.

בנוסף, יש לו נטייה לדלג על שלב החשיבה בשאילתות מסוימות, מה שפוגע באיכות התשובה. כדי לעקוף את זה, היצרן ממליץ להכריח את המודל לפתוח כל פלט עם התגית הייעודית לתחילת חשיבה. בביצועים כלליים שאינם מתמטיקה או קוד, כמו מבחן GPQA Diamond שבו קיבל 49.1, הוא עדיין מתנהג כמו מודל 7B ולא כמו מודל ענק.

אותה משפחה

DeepSeek-R1-Distill-Qwen יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך צריך לנסח את הבקשות כדי לקבל תוצאות טובות?

הימנעו לחלוטין משימוש ב־system prompt ורכזו הכל בפניית המשתמש. לבעיות מתמטיות, מומלץ להנחות אותו במפורש לחשוב צעד אחר צעד ולספק את התשובה הסופית בתוך תיבה ייעודית.

האם המודל דורש כרטיסי מסך מרובים לטעינה?

לא. גודל הקבצים הוא 14.2 גיגה בייט בלבד, כך שמאיץ גרפי בודד עם 16GB או 24GB זיכרון יספיק לטעינה ולהסקה שוטפת.

איך מריצים

המשקל הכולל של הקבצים עומד על 14.2 גיגה בייט בדיוק bfloat16. כדי לטעון אותו ולהשאיר מקום לחישובי הקשר, מומלץ להצטייד במאיץ גרפי בודד עם 16 עד 24 גיגה בייט של זיכרון VRAM. מריצים אותו בקלות דרך מנועים כמו vLLM, ספריית transformers או SGLang.

אם יש לכם צורך בחלון הקשר המלא שמגיע עד 131,072 טוקנים, תצטרכו הרבה יותר זיכרון עבור ה־KV Cache. במקרה כזה, או אם אין לכם חומרה ייעודית זמינה וקבועה, עדיף פשוט להתחבר לממשק ה־API הרשמי של החברה במקום לתחזק שרת עצמאי.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-R1-Distill-Qwen-7B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT, והבסיס שעליו הוא נבנה הגיע במקור מרישיון Apache 2.0. הרישיון מתיר שימוש מסחרי מלא, עריכה, שינוי קוד, והפצה במוצר שלכם, כולל שימוש בפלטים שלו לצורך זיקוק ואימון של מודלים אחרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗