GPT
D

bartowski/DeepSeek-R1-Distill-Llama-70B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-01-20

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF מכווצת של מודל ההסקה בן שבעים מיליארד הפרמטרים, שמביאה יכולות פתרון בעיות מתקדמות לחומרה מקומית. הפתרון מיועד למי שחייב להריץ מודל חשיבה חזק לגמרי אצלו במחשב.

  • 776 GBמשקל הקבצים
  • 16,398הורדות בחודש
  • 45לייקים

מה זה

מדובר במודל Llama בגודל 70B שעבר זיקוק בעזרת תוצרי חשיבה של DeepSeek-R1, ועבר המרה וכימוס לפורמט GGUF בעזרת llama.cpp עם כיול imatrix. הוא מיועד ליצירת טקסט ומשימות הסקה מורכבות, תוך שימוש במבנה פרומפט ייעודי שמפריד בין המערכת, המשתמש והעוזר.

היתרון המרכזי כאן הוא היצע רחב מאוד של כימוסים, החל מאיכות מקסימלית בקובץ של 74.98GB ועד גרסאות דחוסות במיוחד שיורדות ל־16.75GB. הדפי הכימוס כוללים טכניקות מודרניות כמו שימוש ב־Q8_0 למשקולות ההטמעה והפלט בחלק מהגרסאות, לצד תמיכה באריזה מחדש בזמן ריצה עבור מעבדי ARM ופקודות AVX בגרסאות תואמות.

במקום להריץ את משקולות המקור הכבדות, הכימוס מאפשר לשמור על חלק ניכר מאיכות ההסקה תוך צמצום משמעותי בדרישות הזיכרון.

מתאים ל

  • הסקה וניתוח לוגי מקומי

    מביא יכולות פתרון בעיות של מודל 70B ישירות לחומרה המקומית שלכם, בלי להוציא מידע מחוץ לרשת.

  • פיתוח שרתים ללא ענן

    מתאים לשילוב בתוך סביבות פיתוח מקומיות מבוססות llama.cpp או LM Studio במחשבים חזקים.

  • הרצה על מעבדי ARM

    התאמה טובה לעבודה על מעבדי ARM באמצעות פורמטים כמו IQ4_NL שמבצעים אריזה מחדש בזמן ריצה.

איפה זה נופל

הכרטיס מזהיר במפורש שגרסאות הכימוס הנמוכות סובלות מאיכות ירודה. גרסת IQ1_M מוגדרת ככזו שאינה מומלצת כלל, וגם גרסאות ה־Q2 וה־Q3 מוגדרות כבעלות איכות נמוכה עד בינונית. מעבר לכך, גרסאות ה־I-quants לא עובדות עם Vulkan, ומחייבות מעבר ל־ROCm כדי לרוץ על כרטיסי AMD. על מעבדים ועל Apple Metal, גרסאות אלו פועלות לאט יותר מהאלטרנטיבות.

אותה משפחה

DeepSeek-R1-Distill-Llama יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כימוס כדאי לי להוריד אם יש לי מספיק זיכרון?

היוצר ממליץ על Q4_K_M כברירת מחדל לרוב השימושים, או על Q5_K_M ו־Q6_K למי שדורש איכות גבוהה יותר. גרסת Q8_0 נחשבת לרוב מוגזמת ולא נחוצה ביחס למשקל שלה.

האם כדאי להוריד את הגרסאות המכווצות ביותר כמו IQ1_M כדי לחסוך מקום?

לא. הכרטיס מציין במפורש שגרסת IQ1_M היא באיכות נמוכה במיוחד ואינה מומלצת לשימוש, ועדיף לא לרדת מתחת למשפחת ה־Q4 אלא אם אין ברירה אחרת.

איך מריצים

כדי לעבוד במהירות סבירה, תצטרכו להכניס את כל המשקל לתוך זיכרון כרטיס המסך, לפחות גיגה או שניים מתחת לנפח הכולל. עבור גרסת ברירת המחדל המומלצת, Q4_K_M, תצטרכו לפחות 43GB פנויים בכרטיס, מה שמחייב שני כרטיסי מסך מתקדמים או כרטיס מקצועי בודד. אפשר לשלב בין הזיכרון הגרפי לזיכרון המערכת או להריץ דרך LM Studio, אבל המעבר למעבד יאט את העבודה משמעותית.

המדרגות נעות בין Q8_0 הענקית ששוקלת 74.98GB ועד IQ1_M ששוקלת 16.75GB בלבד. אם החומרה שלכם לא מגיעה לנפחים האלה ודורשת כימוס קיצוני מדי שפוגע באיכות, עדיף לפנות ל־API חיצוני ולחסוך את עלויות החומרה.

ollama run hf.co/bartowski/DeepSeek-R1-Distill-Llama-70B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

29 קבצים במאגר, 776 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון לא דווח בעמוד המודל. המשמעות ברורה, מבחינה משפטית אין אישור מפורש לשימוש מסחרי, הפצה או שילוב במוצר קיים. כל עוד תנאי הרישיון של מודל הבסיס ושל הכימוס אינם מוגדרים במפורש, השימוש בו בייצור כרוך בסיכון משפטי לא מבוטל.

הרישיון המלא בעמוד המודל ↗