GPT
D

DeepSeek-R1-Distill-Llama-8B

קוד פתוח

deepseek-aimit2025-01-20

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

גרסה מזוקקת שמביאה את יכולות החשיבה של מודל הדגל לקנה מידה של שמונה מיליארד פרמטרים. היא מתאימה למי שרוצה ביצועי היגיון ומתמטיקה חזקים על כרטיס מסך בודד.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 361,108הורדות בחודש

מה זה

מדובר במודל Llama-3.1-8B שעבר אימון נוסף על דאטה שנוצר על ידי R1 הגדול. הרעיון כאן הוא לקחת את שרשראות החשיבה של מודל ענק ולצרוב אותן לתוך ארכיטקטורה קומפקטית, כך שמקבלים יכולת פתרון בעיות מורכבות בלי להחזיק תשתית שרתים מנופחת.

במבחני ביצועים הוא עוקף מודלים גדולים ממנו בהרבה במשימות חשיבה טהורות. במבחן AIME 2024 הוא מגיע לציון של 50.4, ובמבחן MATH-500 הוא עומד על 89.1. המספרים האלה מראים שהוא פותר אלגברה ובעיות הגיון ברמה גבוהה בהרבה ממודלי בסיס רגילים באותו סדר גודל, אם כי בקוד הוא מעט צנוע יותר עם 39.6 ב־LiveCodeBench.

מתאים ל

  • פתרון בעיות מתמטיקה

    מציג תוצאה של 89.1 במבחן MATH-500 ומסוגל להפיק שרשרת חישוב מפורטת שלב אחרי שלב.

  • אימות לוגיקה מקומי

    רץ מקומית על כרטיס בודד ומתאים לבדיקת תקינות של תהליכים מורכבים מבלי להוציא מידע החוצה.

  • הסבר קטעי קוד

    מנתח היגיון של תוכנה בזכות שרשראות החשיבה שירש מהמודל הגדול, עם דירוג של 1205 ב־Codeforces.

איפה זה נופל

המודל רגיש מאוד להגדרות ההרצה. אם הטמפרטורה לא מכוונת בין 0.5 ל־0.7, הוא עלול להיכנס ללולאות של חזרתיות אינסופית או לפלוט טקסט לא קוהרנטי. אסור להשתמש ב־system prompt, ויש להכניס את כל ההוראות בתוך בקשת המשתמש בלבד.

בנוסף, יש לו נטייה לדלג על שלב החשיבה ולהחזיר תשובה מהירה ופחות מדויקת. כדי לעקוף את זה, צריך לאלץ את הפלט להתחיל ידנית בתגית החשיבה. מבחינת שפות, הביצועים שלו בעברית לא נבדקו בכרטיס המודל.

אותה משפחה

DeepSeek-R1-Distill-Llama יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להגדיר לו הנחיות קבועות מראש?

עדיף שלא. ההנחיה המפורשת היא להימנע לחלוטין משימוש ב־system prompt. יש לכתוב את כל ההוראות והאילוצים כחלק מהפנייה הרגילה של המשתמש כדי לא לפגוע באיכות הפלט.

איך מבטיחים שהוא באמת יפעיל שיקול דעת מעמיק?

היוצרים ממליצים להכריח את המודל להתחיל כל תשובה במחרוזת שפותחת את תגית החשיבה. ללא הצעד הזה, הוא נוטה לעיתים לדלג על שלב ההיגיון ולהפיק מענה שטחי.

האם המודל דורש חומרה מיוחדת כדי לעבוד?

לא. מכיוון שהוא מבוסס על Llama 8B, אפשר להריץ אותו על כרטיס מסך יחיד בעל זיכרון מתאים, בעזרת תוכנות מוכרות כמו vLLM.

איך מריצים

המשקל הכולל של הקבצים בפורמט bfloat16 הוא 15 גיגה בייט, כך שצריך כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי לטעון ולהריץ אותו ישירות. אפשר להפעיל אותו דרך ספריית transformers הרגילה, אבל לסביבת ייצור עדיף להשתמש בכלים כמו vLLM או SGLang שתומכים בארכיטקטורת Llama בצורה יעילה.

אם אתם צריכים רק מענה נקודתי מדי פעם, ההתעסקות עם שרת עצמאי וצריכת הזיכרון כנראה מיותרת, ועדיף לקרוא ל־API הרשמי של החברה.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-R1-Distill-Llama-8B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים בעמוד מפורסמים תחת רישיון MIT, שמתיר שימוש מסחרי, שינוי והפצה חופשית. יחד עם זאת, המודל מתבסס על Llama 3.1 של Meta, כך שחלים עליו גם תנאי הרישיון המקוריים של מודל הבסיס וצריך לקחת אותם בחשבון במוצר סופי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗