GPT
D

unsloth/DeepSeek-R1-Distill-Qwen-7B-GGUF

קוד פתוח

unslothapache-2.02025-01-20

  • transformers
  • gguf
  • deepseek
  • qwen
  • qwen2

גרסת GGUF של מודל החשיבה והמתמטיקה בגודל 7B, שמביאה יכולות הסקת מסקנות מתקדמות מבוססות שרשרת חשיבה ישירות לחומרה מקומית נגישה.

  • 46.3 GBמשקל הקבצים
  • 29,493הורדות בחודש
  • 106לייקים

מה זה

המודל מבוסס על הבסיס של Qwen2.5-Math-7B, ועבר זיקוק באמצעות 800 אלף דוגמאות שנוצרו על ידי DeepSeek-R1 הגדול. הרעיון כאן הוא לקחת את דפוסי החשיבה, הבדיקה העצמית ופתרון הבעיות הרב שלבי שנלמדו במודל הענק, ולהטמיע אותם בתוך ארכיטקטורה קומפקטית שמתאימה להרצה על כרטיס גרפי בודד או אפילו מעבד חזק.

במבחני ביצועים, התוצאות מראות קפיצה גדולה במשימות מדויקות. במבחן המתמטיקה MATH-500 הוא מגיע לתוצאה של 92.8, ובמבחן התחרויות AIME 2024 הוא משיג 55.5 במדד pass@1. המספרים האלה מציבים אותו בעמדה חזקה מאוד מול מודלים קודמים בגודל הזה, ומאפשרים לפתור שאלות לוגיות מורכבות בלי להסתמך על תשתית ענן כבדה.

מתאים ל

  • פתרון בעיות מתמטיות

    מציג ציון 92.8 ב־MATH-500 ומסוגל לבצע בדיקה עצמית שלב אחר שלב.

  • הסקת מסקנות מקומית

    רץ ישירות על חומרה מקומית ללא צורך בהעברת מידע רגיש לשרת חיצוני.

  • לוגיקה רב שלבית קומפקטית

    משלב את דפוסי החשיבה של DeepSeek-R1 בגודל שמתאים לתחנות עבודה רגילות.

איפה זה נופל

המודל רגיש מאוד לאופן שבו פונים אליו. ההנחיות של המפתחים קובעות במפורש שאין להוסיף פרומפט מערכת, וכל ההוראות חייבות להיכנס ישירות לתוך שאלת המשתמש. חריגה מזה עלולה לשבש לחלוטין את התוצאה.

בנוסף, הטמפרטורה חייבת להישאר בטווח צר שבין 0.5 ל־0.7, כשההמלצה היא 0.6. סטייה מהטווח הזה גורמת לעיתים לחזרות אינסופיות או לפלט לא קוהרנטי. בתחום הקוד, עם ציון 37.6 בלבד ב־LiveCodeBench, הוא אינו תחליף למודלים ייעודיים לפיתוח תוכנה.

אותה משפחה

DeepSeek-R1-Distill-Qwen יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך צריך לבנות את הפרומפט למודל?

יש לשים את כל ההנחיות בפניית המשתמש ולעטוף אותה בטוקנים התואמים של המודל. אין להגדיר פרומפט מערכת נפרד. עבור שאלות מתמטיות, מומלץ להוסיף דרישה מפורשת להסביר שלב אחר שלב ולתחום את התשובה הסופית בסוגריים מסולסלים.

מה לעשות אם המודל נתקע בלולאות טקסט?

הסיבה השכיחה לכך היא טמפרטורה לא מתאימה. יש להגדיר את הטמפרטורה לערך קבוע בין 0.5 ל־0.7, כאשר 0.6 הוא הערך המומלץ בדוקומנטציה כדי למנוע חזרות אינסופיות.

איך מריצים

ההרצה מתבצעת דרך llama.cpp באמצעות הפקודה llama-cli. הדף מציג שימוש בגרסת כימות כמו Q4_K_M, יחד עם הגדרת זיכרון מטמון למפתחות בפורמט q8_0. בעת ההרצה חובה להשתמש בטוקנים המזהים של התפקידים, דוגמת תגית משתמש ותגית עוזר, כדי שהמודל יבין את הפנייה בצורה תקינה.

כרטיס מסך בודד של 24GB, למשל RTX 4090, מסוגל לטעון שכבות רבות ישירות לזיכרון הגרפי באמצעות הפקודה n-gpu-layers. אם יש לכם מספר כרטיסים אפשר לפרוס שכבות נוספות, ואפשר גם להריץ על 16 תהליכוני מעבד, אם כי קצב ייצור הטוקנים יהיה איטי יותר מחומרה ייעודית.

ollama run hf.co/unsloth/DeepSeek-R1-Distill-Qwen-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מחולק תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקולות, שילוב במוצרים קיימים והפצה חופשית, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗