GPT
D

DeepSeek-R1-Distill-Qwen-1.5B

קוד פתוח

deepseek-aimit2025-01-20

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

גרסה מכווצת שמביאה יכולות חשיבה וחישוב צעד אחר צעד לתוך משקל של 1.8 מיליארד פרמטרים. היא נועדה למי שחייב מודל קל מאוד שיודע לפתור בעיות לוגיות על חומרה בסיסית.

  • 1.8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 3.3 GBמשקל הקבצים
  • 446,699הורדות בחודש

מה זה

הבסיס כאן הוא המודל Qwen2.5-Math-1.5B, שעבר כוונון עדין על 800 אלף דוגמאות חשיבה שנוצרו על ידי DeepSeek-R1 הגדול. הרעיון הוא להעביר את דפוסי שרשרת המחשבה למודל זעיר בלי לעבור את כל תהליך החיזוקים היקר מאפס.

במבחני ביצועים רואים תמונה מעניינת. במתמטיקה הוא מציג תוצאות חריגות לגודלו, עם ציון של 83.9 במבחן MATH-500 וציון 28.9 ב־AIME 2024, שעוקף אפילו מודלים ענקיים כמו GPT-4o באותו מבחן ספציפי. עם זאת, במשימות תכנות כלליות הוא נעצר ב־16.9 בלבד ב־LiveCodeBench, כך שאי אפשר לצפות ממנו להחליף מודל פיתוח רחב.

מתאים ל

  • פתרון בעיות מתמטיות

    הוא מגיע לציון 83.9 ב־MATH-500, תוצאה חריגה ביחס לגודל קבצים של 3.3 ג'יגה בייט בלבד.

  • חשיבה לוגית במכשיר קצה

    הוא דורש מעט מאוד זיכרון ומאפשר להריץ פירוק שלבים מורכב מקומית בלי חיבור רשת.

  • זיקוק נתונים נוסף

    רישיון MIT המלא מאפשר לייצר בעזרתו נתוני אימון לשרשראות חשיבה עבור מודלים קטנים אחרים.

איפה זה נופל

היוצרים מזהירים במפורש מכמה תופעות בעייתיות. המודל נוטה לפעמים לדלג על שלב החשיבה ולהחזיר תגובה ישירה, מה שפוגע באיכות התוצאה, ולכן הם ממליצים לאלץ את הפלט להתחיל עם תגית החשיבה. בנוסף, חובה להימנע משימוש בהנחיית מערכת ולשים את כל ההוראות בתוך בקשת המשתמש בלבד, תוך שמירה על טמפרטורה מדויקת סביב 0.6 כדי למנוע לולאות אינסופיות של טקסט חוזר. עם ציון דירוג של 954 בלבד ב־CodeForces, הוא חלש מאוד בקוד מורכב.

אותה משפחה

DeepSeek-R1-Distill-Qwen יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מתאים לכתיבת קוד מלא למערכות?

לא. המודל קיבל ציון של 16.9 בלבד ב־LiveCodeBench ודירוג נמוך ב־CodeForces. הוא מיועד לחישובים והסבר שלבים לוגיים, ולא ליצירת קוד מורכב לאפליקציות.

איך מוודאים שהוא באמת מפעיל את מנגנון החשיבה?

היוצרים ממליצים להכריח את הטקסט שנוצר להתחיל במחרוזת שפותחת את בלוק החשיבה. כמו כן, צריך לעבוד בטמפרטורה סביב 0.6 ולא להגדיר הנחיית מערכת כלל.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.3 ג'יגה בייט בפורמט bfloat16, מה שאומר שאפשר לטעון ולהריץ אותו בקלות על כרטיס מסך צרכני פשוט או אפילו על זיכרון של מחשב נייד מודרני. הרצה מקומית נעשית ישירות בעזרת transformers או דרך ספריות כמו vLLM ו־SGLang, בדיוק כמו שמריצים כל מודל ממשפחת Qwen.

אם אתם צריכים רק שאילתות בודדות או פתרון בעיות כבדות באמת, כנראה שעדיף לפנות ל־API הרשמי של DeepSeek-R1 המלא. המודל הקטן הזה משתלם בעיקר כשחייבים עצמאות מלאה ברשת מקומית, פרטיות, או זמני תגובה קצרים בעלות חומרה אפסית.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT, שמעניק חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לשלב אותו בתוך מוצרים סגורים ואפילו להשתמש בפלטים שלו כדי לאמן מודלים אחרים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗