GPT
D

unsloth/DeepSeek-R1-Distill-Qwen-32B-GGUF

קוד פתוח

unslothapache-2.02025-01-20

  • transformers
  • gguf
  • deepseek
  • qwen
  • qwen2

גרסה מכווצת של מודל החשיבה הסיני, שנועדה לתת פתרון מתמטי ותכנותי ברמה גבוהה מאוד על חומרה מקומית. שווה לבדוק אותה כשרוצים ביצועי היקש חזקים בלי לשלם על מודל ענק.

  • 197 GBמשקל הקבצים
  • 33,262הורדות בחודש
  • 167לייקים

מה זה

המודל הזה נשען על בסיס Qwen 2.5 בגודל 32B ועבר אימון על 800 אלף דוגמאות חשיבה שהופקו על ידי DeepSeek-R1 המלא. התוצאה היא מודל שמייצר שרשראות חשיבה מפורטות לפתרון בעיות בלי להחזיק ארכיטקטורת ענק של 671 מיליארד פרמטרים. Unsloth ארזו אותו בפורמט GGUF שמקל על הרצה בספריות מקומיות.

במבחני ביצועים הוא עוקף את o1-mini במתמטיקה ובקוד. הוא מקבל 72.6 במבחן AIME 2024 לעומת 63.6 של המתחרה מבית OpenAI, ומציג 57.2 ב־LiveCodeBench לעומת 53.8. הנתונים האלה מראים שהיכולת לחשוב צעד אחר צעד עברה בהצלחה גם למשקל הקל יותר, והוא מסוגל לפצח בעיות אלגוריתמיות מורכבות.

מתאים ל

  • פתרון בעיות מתמטיות

    משיג 72.6 ב־AIME 2024 ומסוגל לבצע חישובים מורכבים שלב אחר שלב.

  • ייצור ובדיקת קוד

    מתאים לכתיבת אלגוריתמים עם תוצאה של 57.2 ב־LiveCodeBench.

  • אימון מודלים קטנים

    הרישיון מאפשר שימוש בפלטים של המודל לצורך זיקוק למודלים נוספים.

איפה זה נופל

היוצרים מדגישים שאסור לשים System Prompt, וכל ההנחיות חייבות לשבת בתוך הודעת המשתמש. הטמפרטורה חייבת להיות בין 0.5 ל־0.7, כי מחוץ לטווח הזה המודל נכנס לחזרות אינסופיות או פולט שטויות. בנוסף, הוא מסומן לשפה האנגלית בלבד. אם תפנו אליו בעברית תקבלו כנראה שרשראות חשיבה מבולבלות או פלט שבור, שכן הוא לא אומן להתמודד איתה ביעילות.

אותה משפחה

DeepSeek-R1-Distill-Qwen יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל על כרטיס מסך ביתי יחיד של 24GB?

אפשר, אבל לא את כולו בזיכרון הגרפי. תצטרכו להשתמש בגרסת כימוס כמו Q4 ולהעביר חלק מהשכבות למעבד, בדיוק כמו שמודגם בהוראות ההרצה עם 20 שכבות ב־GPU.

האם כדאי להגדיר לו System Prompt מפורט?

לא. ההנחיה הרשמית של המפתחים היא להימנע לחלוטין משימוש ב־System Prompt ולרכז את כל ההוראות והבקשות ישירות בתוך ה־User Prompt כדי לא לפגוע בביצועים.

איך מריצים

להרצה מקומית משתמשים ב־llama.cpp עם תמיכה ב־GGUF, ומגדירים את הפורמט הנכון עם הטוקנים של המשתמש והעוזר. אם יש לכם כרטיס בודד כמו RTX 4090 עם 24GB זיכרון, תצטרכו להוריד קובץ מכווץ כמו Q4_K_M ולפרוק חלק מהשכבות ל־CPU, כי כל ה־32B לא ייכנס בשלמותו ל־VRAM. המפרסמים מדגימים הרצה כזו עם העברת 20 שכבות לכרטיס וממליצים להשתמש ב־q8_0 למטמון.

אם אין לכם כרטיס חזק או מספיק זיכרון מערכת מהיר, ההרצה תהיה אטית להחריד. במצב כזה, עדיף להשתמש ב־API של DeepSeek שזמין ברשת במקום להילחם בחומרה הביתית.

ollama run hf.co/unsloth/DeepSeek-R1-Distill-Qwen-32B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0, בהתאם לרישיון המקורי של סדרת Qwen 2.5 שממנה המודל נגזר. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים ולהפיץ מוצרים מבוססים עליו, בכפוף לתנאי הרישיון הסטנדרטיים של Apache.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗