GPT
D

DeepSeek-R1-Distill-Llama-8B-GGUF

קוד פתוח

unslothllama3.12025-01-20

  • transformers
  • gguf
  • llama
  • text-generation
  • deepseek

גרסת קוונטיזציה של מודל החשיבה וההסקה, המבוססת על הבסיס המוכר של מטא. תקבלו כאן יכולת פתרון בעיות מתמטיות ותכנותיות במעטפת קלה שמיועדת לריצה על חומרה מקומית.

  • 131,072טוקנים בהקשר
  • 140 GBמשקל הקבצים
  • 48,574הורדות בחודש
  • 311לייקים

מה זה

המודל הזה הוא גרסה מכווצת של מודל ההסקה DeepSeek-R1, שעבר זיכוך לתוך ארכיטקטורת Llama 3.1 עם 8 מיליארד פרמטרים. צוות Unsloth ארז אותו בפורמט GGUF שמקל על טעינה מקומית. במקום לאמן מודל קטן מאפס בשיטות חיזוק, לקחו 800 אלף דוגמאות חשיבה שיצר המודל הענק ואימנו איתן את הרשת הזו.

במבחני ביצועים, ההבדל מול מודלים רגילים בגודל הזה ניכר בעיקר בלוגיקה קשה. במבחן AIME 2024 הוא מגיע לתוצאה של 50.4 אחוז במענה ישיר ועד 80 אחוז בדגימה מרובה, ובמבחן MATH-500 הוא עומד על 89.1 אחוז. בפתרון בעיות קוד ב־LiveCodeBench הוא משיג 39.6 אחוז. אלה מספרים שעוקפים מודלים ותיקים וגדולים בהרבה במשימות חישוביות נטו, אבל הוא מפגר אחרי גרסת ה־14B המקבילה.

מתאים ל

  • פתרון בעיות מתמטיות

    הוא מפיק שרשרת חשיבה מפורטת ומגיע לדיוק של 89.1 אחוז במבחן MATH-500 ללא צורך בענן.

  • ניתוח ואיתור באגים בקוד

    מתאים להרצה בסביבת פיתוח מבודדת כדי לעבור שלב אחר שלב על אלגוריתמים מורכבים.

  • שרת הסקה מקומי ומאובטח

    רץ ישירות על חומרה מקומית דרך llama.cpp עבור מידע רגיש שלא יכול לצאת לרשת.

איפה זה נופל

היוצרים מדגישים חולשות ברורות בהתנהגות המודל. אסור לחלוטין להגדיר פקודת מערכת (system prompt), וכל ההנחיות חייבות להיכנס ישירות לפרומפט של המשתמש, אחרת איכות התשובה נפגעת. בנוסף, חובה לקבע טמפרטורה סביב 0.6. טמפרטורה שונה תגרור חזרתיות אינסופית או פלט מבולבל.

מבחינת שפות, המודל מוגדר רשמית לאנגלית בלבד. הוא לא נבדק לעברית ויש סיכון גבוה לערבוב שפות או כשלים בהבנה תחבירית. הוא גם לא מתאים למשימות צ'אט כלליות או כתיבה יצירתית, כי המבנה שלו מכוון לייצר שרשרת חשיבה מתישה לפני כל תשובה.

אותה משפחה

DeepSeek-R1-Distill-Llama יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מונעים ממנו לחזור על עצמו בלולאות?

מגדירים את הטמפרטורה בטווח שבין 0.5 ל־0.7, כאשר ההמלצה הרשמית של המפתחים היא 0.6 בדיוק. מעבר לכך, חובה להשתמש בטוקנים התחביריים הייעודיים של המשתמש והעוזר, ולא להשתמש בהוראות מערכת מקדימות.

האם המודל תומך בעברית לשימוש במוצר מקומי?

הכרטיס הרשמי מגדיר תמיכה באנגלית בלבד. מודלים מסוג R1 עלולים לייצר ערבוב שפות ולתרגם גרוע שרשראות חשיבה, לכן לא מומלץ להסתמך עליו בעיבוד טקסטים בעברית ללא בדיקה קפדנית מראש.

כמה זיכרון דרוש כדי להריץ את גרסת ה־8B?

זה תלוי בקובץ הכיול שבוחרים מתוך המאגר. עבור כיול Q4_K_M טיפוסי תצטרכו סביב 6 עד 8 גיגה-בייט של זיכרון עבודה או זיכרון כרטיס מסך, בעוד שכרטיס כמו RTX 4090 עם 24GB מאפשר לפרוק את רוב השכבות ולקבל ריצה חלקה.

איך מריצים

אתם מורידים את הקובץ המתאים ומריצים ישירות דרך llama.cpp מהטרמינל. בריצה עם כרטיס בודד כמו RTX 4090 עם 24GB זיכרון, אפשר להוריד כ־20 שכבות לכרטיס המסך ולקבל מהירות תגובה מעולה, או לחלופין לרוץ על מעבד מרכזי בלבד עם חלוקת תהליכונים.

הריפוזיטורי מכיל מספר גרסאות כיול בנפח כולל של כ־140 גיגה-בייט, החל מכיולים קיצוניים של 1.58 ביט ועד Q4_K_M ו־Q8. תבחרו את הקובץ הספציפי שמתאים לנפח ה־RAM הפנוי שלכם. אם אין לכם שום מאיץ גרפי סביר ואתם צריכים רק שאלות בודדות פעם ביום, שווה לקרוא ל־API של DeepSeek ולחסוך התקנות מקומיות.

ollama run hf.co/unsloth/DeepSeek-R1-Distill-Llama-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקוד הפתוח של הפרויקט מופץ תחת רישיון MIT, אך משקלי המודל עצמם כפופים לתנאי הרישיון המקוריים של llama3.1 מבית מטא. הרישיון מתיר שימוש מסחרי, כל עוד המוצר שלכם לא משרת יותר מ־700 מיליון משתמשים פעילים בחודש, ובתנאי שאתם שומרים על תנאי ההפצה והמדיניות של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗