GPT
D

DeepSeek-R1-Distill-Qwen-32B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-01-20

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF מכווצת של מודל החשיבה וההסקה, שמביאה ביצועים מתקדמים למחשב מקומי בלי לשלוח נתונים החוצה. שילוב בין זיקוק ידע מוצלח לגודל שעדיין אפשר להריץ עצמאית.

  • 483 GBמשקל הקבצים
  • 48,812הורדות בחודש
  • 324לייקים

מה זה

מדובר בהמרה של המודל המזוקק לפורמט llama.cpp, שנוצרה באמצעות כיול imatrix כדי לשמור על דיוק מקסימלי בזמן כיווץ המשקלים. המודל מייצר טקסט, קוד והסברים מנומקים, כשהוא נשען על יכולות החשיבה שחולצו מהגרסאות הגדולות. הוא סוגר פער ביצועים משמעותי מול משקלים מלאים, במיוחד בהשוואה למה שהורגלנו לראות בקטגוריית שלושים ושניים מיליארד הפרמטרים.

הכרטיס מציע טווח רחב של גרסאות, החל מקבצים של 9.03 ג'יגה בייט בכיול נמוך ועד 65.54 ג'יגה בייט במשקל מלא. המפרסם ממליץ בעיקר על קובצי Q4_K_M של 19.85 ג'יגה בייט או Q6_K סביב 26.89 ג'יגה בייט, שמספקים שיווי משקל נכון בין איבוד איכות מינימלי לבין משאבי זיכרון סבירים.

מתאים ל

  • פיתוח מקומי ללא רשת

    הרצה מקומית ב־LM Studio לעבודה על קוד ולוגיקה ללא חשיפת מידע לשרתים חיצוניים.

  • הסקה על מעבדי ARM

    שימוש בגרסאות Q4_0 או IQ4_NL שמנצלות סידור מחדש של המשקלים להאצת מהירות העיבוד במעבד.

  • בדיקת יכולות חשיבה

    הרצת מודל הסקה מתקדם במשקל בינוני של Q4_K_M כדי לבחון מענה לשאלות מורכבות במחשב בודד.

איפה זה נופל

הגרסאות המכווצות ביותר, כמו IQ2_XXS ששוקלת כ־9.03 ג'יגה בייט, סובלות מירידה ניכרת באיכות הפלט והכרטיס מגדיר אותן כבעלות איכות נמוכה מאוד. בנוסף, קובצי I-quant אינם תואמים להרצה תחת Vulkan, ועל מעבדים רגילים או Apple Metal הם יעבדו לאט יותר מחלופות K-quant רגילות. חובה להשתמש בפורמט הפרומפט הספציפי שכולל תגיות התחלה, אחרת תקבלו תוצאות משובשות.

אותה משפחה

DeepSeek-R1-Distill-Qwen יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד למחשב שלי?

ההמלצה הכללית בדף היא על קובץ Q4_K_M בגודל 19.85 ג'יגה בייט עבור רוב המקרים. אם יש לכם זיכרון עודף, קובצי Q5 או Q6 יתנו איכות כמעט מושלמת. אם הזיכרון לחוץ, עדיף לבחור בגרסאות ה־I-quants כמו IQ4_XS.

למה התשובות יוצאות מקולקלות או לא קשורות?

המודל דורש תבנית פנייה קבועה שמתחילה בתגית ייעודית ומפרידה בין המערכת, המשתמש והעוזר. אם מזינים טקסט חופשי בלי התבנית הזו, יכולת ההסקה והמענה נפגעת בצורה קשה.

איך מריצים

את הקבצים מריצים מקומית דרך llama.cpp או תוכנות תומכות כמו LM Studio. כדי לעבוד במהירות סבירה תצטרכו כרטיס גרפי עם זיכרון שגדול בלפחות גיגה או שניים מקובץ המודל, או לחלופין שילוב של זיכרון מערכת וכרטיס מסך על חשבון מהירות היצירה. לחומרה מבוססת מעבדי ARM או AVX, יש אפשרות להרצה מקוונת של משקלים בפורמט Q4_0 לשיפור קצב העיבוד.

אם אין לכם זיכרון פנוי שמגיע לכעשרים גיגה בייט לפחות, תצטרכו לרדת לגרסאות IQ2 או IQ3 שנפחן נמוך יותר אך מחירן באיכות מורגש, או פשוט לפנות לשירות מרוחק.

ollama run hf.co/bartowski/DeepSeek-R1-Distill-Qwen-32B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

30 קבצים במאגר, 483 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון של החבילה הזו לא דווח בעמוד. המשמעות היא שאין הרשאה משפטית ברורה לשימוש מסחרי או להפצה בתוך מוצר, ולפני שמשלבים אותה בקוד של חברה חייבים לבדוק את תנאי השימוש של מודל המקור.

הרישיון המלא בעמוד המודל ↗