GPT
D

DeepSeek-R1-Distill-Llama-70B-GGUF

קוד פתוח

unslothllama3.32025-01-20

  • transformers
  • gguf
  • llama
  • text-generation
  • deepseek

הסבה של מודל הדגל מבית דיפסיק לתוך ארכיטקטורת לאמה המוכרת בקבצי גיגאף. הוא מביא יכולות חשיבה ופתרון בעיות מתמטיות למכונות מקומיות בלי להזדקק לחוות שרתים ענקית.

  • 131,072טוקנים בהקשר
  • 1.2 TBמשקל הקבצים
  • 196,495הורדות בחודש
  • 121לייקים

מה זה

מדובר במודל לאמה 3.3 בגודל שבעים מיליארד פרמטרים שעבר זיקוק באמצעות פלטים של דיפסיק אר 1, במטרה לחקות את דפוסי החשיבה שלו. צוות אנלות' לקח את המשקלים האלה והמיר אותם לפורמט גיגאף כדי לאפשר הרצה מקומית יעילה דרך ספריות מבוססות סי. הוא יודע לבצע תהליכי היסק מורכבים בשרשרת מחשבה, ומיועד להנדסת תוכנה, מתמטיקה ומשימות לוגיות תובעניות.

במבחני הביצועים המודל מציג תוצאות חזקות ביותר לגודלו. הוא מגיע לציון של 70 במבחן המתמטיקה איימי 2024, ומטפס ל־86.7 תחת בדיקת עקביות של שישים וארבע דגימות. במבחן מאת' 500 הוא פוגע ב־94.5 אחוז דיוק, ועוקף את קלוד 3.5 סונט וג'יפיטי 4 או במדדי קוד כמו לייבקודבנץ' עם 57.5 אחוזי הצלחה. המשמעות היא שביכולת ניתוח טכנית נטו הוא מתחרה במודלי ענן סגורים, אך במעטפת קומפקטית בהרבה.

מתאים ל

  • פתרון בעיות אלגוריתמיות

    הוא מגיע לרייטינג 1633 בקודפורסס ומצטיין בכתיבת קוד מורכב עם שרשרת חשיבה.

  • הוכחות וחישובים במתמטיקה

    הוא משיג 94.5 אחוז במבחן מאת' 500 ומסוגל לנמק צעדים עד לקבלת התוצאה.

  • ניתוח לוגי בארגונים סגורים

    הוא מאפשר יכולות היסק של מודלים ענקיים על גבי שרת מקומי ומאובטח.

איפה זה נופל

חובה לוותר לחלוטין על סיסטם פרומפט, כי המודל לא הוכשר לעבוד איתו וכל ההנחיות חייבות להיכנס ישירות לפרומפט של המשתמש. הכרטיס מדגיש שחריגה מהטמפרטורה המומלצת מובילה לחזרתיות אינסופית או פלטים לא קוהרנטיים. בנוסף, המודל מוגדר רשמית לשפה האנגלית בלבד, וצריך לבדוק אותו היטב במשימות שפה טבעית רגילות שאינן לוגיקה או קוד.

אותה משפחה

DeepSeek-R1-Distill-Llama יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להריץ אותו על כרטיס מסך בודד של 24GB?

אפשר לפרוק כעשרים שכבות לכרטיס המסך ואת השאר להשאיר במעבד ובזיכרון המערכת. הביצועים יהיו איטיים למדי ולא יתאימו למוצר שדורש תגובה מהירה למשתמש.

למה אסור להשתמש בסיסטם פרומפט הרגיל?

האימון של המודל הסתמך על תבנית קשיחה שבה ההוראות יושבות ישירות בתוך פניית המשתמש. הוספת סיסטם פרומפט משבשת את תהליך ההיסק ופוגעת בדיוק התשובות.

איך מריצים

בשביל להריץ שבעים מיליארד פרמטרים בגרסת קוונטיזציה נפוצה כמו קיו 4 תצטרכו לפחות ארבעים ג'יגה זיכרון פנוי. כרטיס בודד של עשרים וארבעה ג'יגה כמו ארטיאיקס 4090 לא מספיק לבד, ותצטרכו לפצל שכבות בין המעבד הגרפי לזיכרון הראשי דרך לאמה סיפיפי, מה שיאט מאוד את קצב יצירת הטוקנים.

אם אין לכם שני כרטיסי מסך חזקים או שרת ייעודי, עדיף להשתמש ב־API המוכן של דיפסיק בענן. למי שמתעקש להריץ מקומית, ההוראות מחייבות שימוש בטוקנים המיוחדים של יוזר ואסיסטנט, והגדרת טמפרטורה סביב 0.6.

ollama run hf.co/unsloth/DeepSeek-R1-Distill-Llama-70B-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

41 קבצים במאגר, 1.2 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים כפופים לרישיון לאמה 3.3 של חברת מטא. הרישיון מתיר שימוש מסחרי ומחקר, אך מטיל מגבלות שימוש מקובלות של מטא, כולל דרישה לאישור מיוחד אם המוצר מגיע למאות מיליוני משתמשים פעילים בחודש.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗