GPT
D

DeepSeek-R1-Distill-Qwen-32B

קוד פתוח

deepseek-aimit2025-01-20

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

זיקוק של מודל החשיבה R1 לתוך ארכיטקטורת Qwen בגודל 32B. הוא מביא ביצועי היגיון ומתמטיקה ברמה של מודלים סגורים, אבל בחומרה שאתם יכולים להחזיק בעצמכם.

  • 33Bפרמטרים
  • 131,072טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 537,215הורדות בחודש

מה זה

הבסיס כאן הוא Qwen 2.5 בנפח של כמעט 33 מיליארד פרמטרים, שעבר אימון על 800 אלף דוגמאות חשיבה שנלקחו ישירות מ־R1 המלא. המטרה היא להעביר את תהליכי החשיבה והבדיקה העצמית של מודל ענק למבנה צפוף וקומפקטי בהרבה.

במבחני ביצועים, ההבדל מול מודלים רגילים בולט מאוד. במתמטיקה מורכבת של AIME 2024 הוא מגיע ל־72.6 אחוז בפתרון ראשון, תוצאה שעוקפת את o1-mini שמגרד 63.6 אחוז, ומשאירה מאחור מודלים כלליים כמו GPT-4o שמקבלים 9.3 בלבד. גם ב־LiveCodeBench הוא עומד על 57.2 אחוז. בפועל, זה אומר שהוא יודע לפרק בעיות הנדסיות וחישוביות לעומק במקום לנחש תשובות שטחיות.

מתאים ל

  • פתרון בעיות מתמטיקה

    הוא מגיע ל־72.6 אחוז ב־AIME 2024, מה שהופך אותו לאחד הכלים הבודדים שרצים מקומית ופותרים חישובים קשים.

  • ניתוח וייצור קוד מורכב

    עם ציון 1691 ב־Codeforces, הוא מתאים לבניית אלגוריתמים מסובכים שמצריכים תכנון מקדים ולא רק השלמת קוד שגרתית.

  • משימות היגיון מרובות שלבים

    הוא מייצר שרשרת חשיבה ארוכה ובודק את עצמו לפני מתן המענה, מה שחוסך טעויות גסות של הנחה מוקדמת.

איפה זה נופל

לפי הנחיות המפתחים, אסור להגדיר לו פרומפט מערכת אלא לרכז את כל ההנחיות בבקשת המשתמש בלבד, והטמפרטורה חייבת להישאר בטווח צר של 0.5 עד 0.7 כדי למנוע לולאות אינסופיות או טקסט לא קוהרנטי. בנוסף, יש לו נטייה לדלג על שלב החשיבה בשאלות מסוימות ולהחזיר תגיות ריקות, מה שפוגע באיכות התשובה. כדי לעקוף את זה, צריך לאלץ את הפלט שלו להתחיל ידנית עם תגית הפתיחה של החשיבה בכל פנייה.

אותה משפחה

DeepSeek-R1-Distill-Qwen יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בפרומפט מערכת רגיל?

עדיף להימנע מזה לחלוטין. היוצרים מבהירים במפורש שכל הוראה צריכה להיכנס ישירות לפרומפט המשתמש, אחרת איכות החשיבה נפגעת.

איך דואגים שהוא באמת יפעיל שיקול דעת ולא ימהר לענות?

המפתחים מציעים לכפות על המודל להתחיל את הפלט בטקסט שפותח את בלוק החשיבה. צעד כזה מכריח אותו להיכנס למסלול הניתוח העמוק ולא לקפוץ ישר לתוצאה.

איך מריצים

המשקל הגולמי של הקבצים בפורמט bfloat16 עומד על 61 ג'יגה־בייט. כדי להריץ אותו בלי קוונטיזציה תצטרכו שרת עם שני כרטיסי מסך חזקים, כפי שממליצה פקודת ההרצה של vLLM ו־SGLang עם חלוקה של שרשור מקבילי לשניים.

אם אין לכם כרטיסי עיבוד מתאימים בענן או במשרד, הפעלת תשתית כזו לניסוי ראשוני היא הוצאה מיותרת. במצב כזה עדיף לקרוא ישירות ל־API של DeepSeek שפועל במתכונת תואמת OpenAI, ורק כשהצורך באבטחת מידע או בעבודה מקומית נהיה קריטי, להקים את השרת אצלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="deepseek-ai/DeepSeek-R1-Distill-Qwen-32B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון MIT, והמודל המקורי מבוסס על סדרת Qwen ברישיון Apache 2.0. הרישיון מתיר שימוש מסחרי חופשי, שינויים, יצירת נגזרות והפצה בתוך מוצרים, כולל שימוש בפלטים שלו כדי לזקק ולאמן מודלים אחרים, ללא מגבלות שימוש נוקשות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗