GPT
D

DeepSeek-R1-Distill-Llama-70B

קוד פתוח

deepseek-aimit2025-01-20

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

זה מודל שמשלב את יכולות ההסקה המורכבות של סדרת R1 בתוך משקלי Llama 3.3 המוכרים. הוא נותן חשיבה מעמיקה בלי צורך בתשתית החריגה של מודלי תערובת מומחים ענקיים.

  • 71Bפרמטרים
  • 131,072טוקנים בהקשר
  • 131 GBמשקל הקבצים
  • 79,657הורדות בחודש

מה זה

מדובר במודל צפוף של 70 מיליארד פרמטרים שעבר אימון עדין על בסיס Llama 3.3 Instruct, תוך שימוש בנתוני זיקוק שהופקו מהמודל הגדול R1. במקום לחקות רק את התשובות הסופיות, הוא מחקה את תהליך פתרון הבעיות השלם, כולל שלבי בדיקה עצמית וחשיבה פנימית ארוכה.

במבחני ביצועים הוא עוקף מודלים סגורים כמו Claude 3.5 Sonnet ומתקרב מאוד לביצועי o1-mini במתמטיקה ובקוד. בבנצ'מרק AIME 2024 הוא הגיע לציון 70 במענה בודד ועד 86.7 בבדיקה מדגמית של 64 תשובות, לצד דיוק של 94.5 במבחן MATH 500. המספרים האלה מראים שהוא מתמודד עם בעיות לוגיות מורכבות בצורה הרבה יותר מסודרת ממודלי בסיס רגילים באותו גודל.

מתאים ל

  • פתרון בעיות מתמטיות

    הוא מציג תוצאה של 94.5 אחוז ב־MATH 500 ומסוגל לבצע חישובים רב־שלביים עקביים.

  • יצירת קוד ובדיקות

    הציון שלו במבחני קוד מגיע ל־57.5 ב־LiveCodeBench, והוא מתאים לפתרון באגים מורכבים.

  • הערכת תהליכי חשיבה

    הוא מייצר את שרשרת ההסקה המלאה לפני התשובה, מה שמאפשר לבדוק את ההיגיון שלו.

איפה זה נופל

היוצרים מזהירים שהמודל נוטה לפעמים לדלג על שלב החשיבה ולייצר תגיות ריקות, מה שפוגע באיכות הפתרון. כדי לעקוף את זה צריך לאלץ את הפלט להתחיל ידנית בתגית הפתיחה של החשיבה. בנוסף, אסור להגדיר לו הנחיית מערכת נפרדת, אלא לרכז את כל ההוראות ישירות בבקשת המשתמש. אם מגדירים טמפרטורה מחוץ לטווח של 0.5 עד 0.7, הוא עלול להיכנס ללולאות של חזרות אינסופיות או לפלוט טקסט לא קוהרנטי.

אותה משפחה

DeepSeek-R1-Distill-Llama יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בהנחיית מערכת רגילה?

עדיף שלא. היוצרים ממליצים במפורש להימנע מהנחיית מערכת ולהכניס את כל הדרישות ישירות לפרומפט של המשתמש כדי למנוע ירידה בביצועים.

איך מוודאים שהמודל באמת מפעיל תהליך חשיבה?

הכרטיס ממליץ לכפות על המודל להתחיל את המענה עם תגית החשיבה הראשונית. אם לא מאלצים אותו, הוא עלול לענות מיד בתשובה קצרה ולפספס את היתרון של בדיקה עצמית.

איך מריצים

כדי להריץ אותו בדיוק המקורי שלו של bfloat16 תצטרכו כ־140 גיגה של זיכרון וידאו, מה שדורש לפחות שני כרטיסי A100 או H100 של 80 גיגה. אפשר להפעיל אותו דרך vLLM או SGLang באותו אופן שמריצים כל מודל Llama סטנדרטי, אבל נדרש מקביליות טנזורים של שני כרטיסים לפחות.

אם אין לכם שרת ייעודי בענן או מקבץ כרטיסים זמין, עדיף להשתמש ב־API מוכן. הפעלת מודל כזה באופן עצמאי הגיונית רק אם המידע שלכם רגיש ואסור לו לצאת מהרשת המקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-R1-Distill-Llama-70B")
print(pipe("שלום"))

הרישיון

הפרויקט מפורסם תחת רישיון MIT שמתיר שימוש מסחרי, שינויים והפצה חופשית. עם זאת, המודל מתבסס במקור על Llama 3.3 של מטא, מה שיוצר כפילות ברישוי שמחייבת בדיקה משפטית לגבי תנאי השימוש המקוריים של Llama כשמשלבים אותו במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗