GPT
D

DeepSeek-R1-Distill-Qwen-14B

קוד פתוח

deepseek-aimit2025-01-20

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

גרסה מזוקקת של מודל החשיבה R1 על בסיס Qwen, שמביאה ביצועים מתמטיים של מודלי ענק לחומרה מקומית נגישה.

  • 15Bפרמטרים
  • 131,072טוקנים בהקשר
  • 27.5 GBמשקל הקבצים
  • 356,704הורדות בחודש

מה זה

הבסיס כאן הוא Qwen2.5 בנפח 14 מיליארד פרמטרים, שעבר כוונון בעזרת 800 אלף דוגמאות חשיבה שיצר המודל המלא R1. במקום לאמן מודל מאפס עם למידת חיזוק, לקחו מודל קומפקטי יחסית ולימדו אותו לחקות את שרשרת המחשבה של מודל ענק. התוצאה היא יכולת ניתוח עמוקה במשימות הגיון, קוד ומתמטיקה, בלי להחזיק תשתית שרתים מנופחת.

במדד המתמטיקה AIME 2024 המודל מגיע לתוצאה של 69.7 אחוז במענה ראשון, ובמדד MATH-500 הוא רושם 93.9 אחוז. בפועל, המספרים האלה מציבים אותו מעל מודלים קנייניים כבדים כמו GPT-4o במשימות חישוב טהורות. גם בתכנות הוא עומד על 53.1 אחוז ב־LiveCodeBench ודירוג 1481 ב־CodeForces, מה שהופך אותו לכלי חזק לפתרון בעיות אלגוריתמיות מורכבות.

השילוב בין ארכיטקטורת Qwen ליכולות ההסקה של R1 מייצר מודל שיודע לבדוק את עצמו ולתקן שגיאות תוך כדי כתיבה. הוא פחות מיועד לשיחה קלילה או לשליפת עובדות יבשות, ויותר לפירוק לוגי שיטתי של בעיות שדורשות כמה צעדי מחשבה לפני שמגיעים לתשובה הסופית.

מתאים ל

  • פתרון בעיות באלגוריתמיקה

    מייצר קוד יעיל ומתמודד היטב עם שאלות תחרותיות בזכות יכולת ההסקה המובנית.

  • עוזר מחקר במתמטיקה

    מפרק הוכחות וחישובים מורכבים צעד אחר צעד ברמת דיוק גבוהה של 93.9 אחוז ב־MATH-500.

  • אימות קוד ובדיקת תקינות

    בוחן מקרי קצה ומבצע תיקון עצמי בזמן יצירת שרשרת המחשבה לפני הפלט הסופי.

איפה זה נופל

היוצרים מדגישים שחובה להגדיר טמפרטורה בין 0.5 ל־0.7, כי כל ערך אחר גורר חזרתיות אינסופית או פלט מבולבל. אסור להשתמש ב־system prompt, ויש להכניס את כל ההנחיות רק בהודעת המשתמש. בנוסף, המודל נוטה לעיתים לדלג על שלב החשיבה, ולכן צריך לכפות עליו להתחיל את התשובה עם תגית think פתוחה כדי לא לפגוע באיכות הפתרון.

אותה משפחה

DeepSeek-R1-Distill-Qwen יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לצ'אט שירות לקוחות רגיל?

לא מומלץ. הוא אומן לחשיבה מאומצת ולפתרון בעיות שלב אחר שלב, ולכן ייצר תגיות חשיבה ארוכות שיעכבו את התשובה ויבזבזו משאבים על משימות שיחה פשוטות.

איך מבטיחים שהמודל יפיק את התוצאה המדויקת ביותר?

צריך לוודא שהתשובה מתחילה בתגית think כדי להפעיל את תהליך ההסקה, לכוון טמפרטורה ל־0.6, ולהימנע לחלוטין משימוש ב־system prompt.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־27.5 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם 32 גיגה זיכרון לפחות, כמו A100 או זוג כרטיסי RTX 3090, כדי להריץ אותו בצורה נקייה בלי קוונטיזציה. אפשר להעלות אותו עם vLLM או SGLang בדיוק כמו שמריצים כל מודל מסדרת Qwen.

אם אין לכם כרטיסי מסך מתאימים או שאתם לא רוצים לשלם על שרת ייעודי בענן, עדיף לפנות ישירות ל־API ש־deepseek מציעה בפלטפורמה שלה, שתומך בממשק של OpenAI. זה חוסך את עלויות התחזוקה ומספק זמני תגובה טובים יותר בלי צורך לנהל מופעים בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-R1-Distill-Qwen-14B")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT מלא שמאפשר שימוש מסחרי, שינוי קוד והפצה של יצירות נגזרות ללא תמלוגים. מותר גם להשתמש בפלטים שלו לזיקוק מודלים אחרים, בתנאי ששומרים על הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗