GPT
D

DeepSeek-R1-Distill-Llama-8B-unsloth-bnb-4bit

קוד פתוח

unslothllama3.12025-01-20

  • transformers
  • safetensors
  • llama
  • text-generation
  • deepseek

גרסה מכווצת ב־4 ביט של Llama-8B שעברה אימון על שרשראות חשיבה של DeepSeek-R1. היא נותנת יכולת פתרון בעיות לוגיות על כרטיס מסך בסיסי.

  • 8.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 5.6 GBמשקל הקבצים
  • 5,205הורדות בחודש

מה זה

בבסיס יושב מודל Llama-3.1-8B שכוונן על 800 אלף דוגמאות חשיבה שנלקחו מהמודל הגדול של DeepSeek, וצוות Unsloth ארז אותו בכימות 4 ביט דינמי ששוקל 5.6 גיגה בייט בלבד. המטרה היא להביא התנהגות של שרשרת חשיבה, כמו אימות עצמי ותיקון טעויות תוך כדי ריצה, לגודל שיכול לעבוד כמעט בכל מקום.

במבחנים של גרסת ה־8B המזוקקת, היא עוקפת מודלים ענקיים במשימות ספציפיות: ציון של 50.4 ב־AIME לעומת 9.3 בלבד ב־GPT-4o, ו־89.1 ב־MATH-500. זה אומר שבחישובים מתמטיים מוגדרים הוא מבריק יחסית לממדיו, אבל במדדי קוד כמו LiveCodeBench הוא עומד על 39.6, כך שלא מדובר בתחליף למודל תכנות ייעודי אלא בעיקר במנוע היסקים קומפקטי.

מתאים ל

  • פתרון בעיות מתמטיקה

    משיג 89.1 ב־MATH-500 ופותר בעיות חישוב שלב אחר שלב בחומרה מקומית זולה.

  • אימות לוגיקה מקומי

    מבצע בדיקות היקש ואימות נתונים על שרתים פנימיים בלי להוציא מידע רגיש החוצה.

  • הסבר תהליכי חשיבה

    מייצר פלט מפורט שמציג את שיקולי הפתרון לפני התשובה הסופית עבור מערכות לימוד.

איפה זה נופל

היוצרים מדגישים חובה להגדיר טמפרטורה בין 0.5 ל־0.7, אחרת המודל נכנס לחזרות אינסופיות או פולט בליל לא ברור. בנוסף, המודל מוגדר רשמית לאנגלית בלבד, כך שאין לצפות לביצועים סבירים בעברית, והאימון ללא מענה אנושי ישיר מייצר לעיתים ערבוב שפות וניסוחים קשים לקריאה.

שאלות
נפוצות

איזה כרטיס מסך צריך בשביל להריץ אותו?

הקבצים שוקלים 5.6 גיגה בייט, כך שכרטיס של 8GB כמו RTX 3060 או 4060 יספיק לטעינה. לחלונות הקשר ארוכים מאוד מומלץ כרטיס של 12GB או 16GB.

למה התשובות שלו יוצאות מבולבלות או חוזרות על עצמן?

זה קורה אם שוכחים לקבוע טמפרטורה בטווח שבין 0.5 ל־0.7 לפי הנחיות היצרן. במודלי חשיבה מזוקקים, דגימה מחוץ לטווח הזה שוברת את רצף ההיקש.

איך מריצים

המשקל הכולל ירד ל־5.6 גיגה בייט, כך שאפשר להריץ אותו בקלות על כרטיס צרכני פשוט כמו RTX 3060 או בתוך מחברת חינמית עם כרטיס T4 של 16GB. תמיכת ספריות נעשית דרך transformers ו־vLLM כרגיל.

אם אתם צריכים רק שאילתות בודדות פעם בכמה שעות, עדיף להשתמש ב־API של DeepSeek ולשלם לפי טוקן במקום להחזיק שרת דולק. הרצה עצמית שווה בעיקר כשאתם מעבדים מידע רגיש שלא יכול לצאת מהתשתית שלכם, או כשאתם בונים סוכן שרץ בלולאות כבדות.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/DeepSeek-R1-Distill-Llama-8B-unsloth-bnb-4bit")
print(pipe("שלום"))

הרישיון

הרישיון הוא llama3.1 של Meta. מותר להשתמש בו לצרכים מסחריים ופיתוח פנימי, כל עוד המוצר שלכם לא חוצה 700 מיליון משתמשים פעילים בחודש, שאז נדרש אישור פרטני מ־Meta.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗