GPT
D

bartowski/DeepSeek-R1-Distill-Qwen-14B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-01-20

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF מכווצת של מודל ההסקה 14B שזוקק מתוך R1 ומבוסס על Qwen. מיועד למי שרוצה יכולות חשיבה ופתרון בעיות מתמטיות או קוד ישירות על החומרה המקומית.

  • 273 GBמשקל הקבצים
  • 45,922הורדות בחודש
  • 249לייקים

מה זה

מדובר במודל DeepSeek R1 Distill שמבוסס על ארכיטקטורת Qwen בגודל 14 מיליארד פרמטרים, כפי שכווץ לפורמט GGUF על ידי bartowski בעזרת llama.cpp בגרסה b4514. המודל מתמקד במשימות יצירת טקסט עם דגש על שרשרת חשיבה והסקה לוגית, כשהוא מביא חלק מהיכולות של R1 הגדול לתוך משקל שמתאים לחומרה צרכנית.

הייחוד כאן הוא בשיטת הכיווץ, שבוצעה כולה באמצעות imatrix כדי למזער פגיעה באיכות התוצרים, יחד עם שמירה על משקלי הטמעה ופלט ברמה גבוהה של שמונה ביט בחלק מהגרסאות. זה מאפשר לקבל תוצאות מדויקות יותר ביחס לגדלים דומים שלא עברו כיול כזה.

מתאים ל

  • פתרון בעיות היגיון וקוד

    מתאים להרצה מקומית של משימות פיתוח ומתמטיקה בזכות הזיקוק ממודל ההסקה R1.

  • עיבוד מקומי ומאובטח

    מאפשר ניתוח טקסט רגיש על גבי GPU מקומי ללא שליחת מידע לשרתים חיצוניים.

  • הרצה על חומרה בינונית

    גרסאות ה־Q4 מאפשרות קבלת יכולות חשיבה מתקדמות גם על כרטיסי מסך בעלי 12GB VRAM.

איפה זה נופל

הכרטיס לא מציג מבחני ביצועים ישירים עבור המודל עצמו אלא רק הדגמות ארכיטקטורה כלליות, כך שאין כאן התחייבות רשמית לרמת הדיוק במשימות ספציפיות. מעבר לכך, גרסאות הכיווץ הקיצוניות מתחת לארבעה ביט מוגדרות מראש כבעלות איכות נמוכה יותר, ובגרסאות ה־IQ יש מגבלות תאימות וחוסר תמיכה מלא ב־Vulkan שמחייבות בדיקה מוקדמת של סביבת הריצה.

בנוסף, חובה להשתמש במבנה התגים המדויק שהוגדר למודל כדי לקבל תוצאות תקינות, אחרת איכות התשובות וההיגיון הלוגי נפגעים מיד.

אותה משפחה

DeepSeek-R1-Distill-Qwen יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד למחשב עם כרטיס מסך יחיד?

האפשרות המאוזנת ביותר היא Q4_K_M שדורשת כ־9 גיגהבייט זיכרון גרפי ומספקת איכות עבודה טובה מאוד. אם יש לכם כרטיס מסך מרווח יותר, גרסת Q6_K תיתן תוצאה קרובה מאוד למקור.

האם אפשר להריץ את המודל על מעבדי ARM או מעבדי מחשב רגילים?

כן, גרסאות כמו Q4_0 ו־IQ4_NL כוללות סידור משקלים מחדש שמשפר ביצועים על מעבדי ARM ו־AVX. עם זאת, קצב יצירת הטקסט יהיה אטי משמעותית בהשוואה להרצה על כרטיס גרפי ייעודי.

איך מריצים

כדי להריץ אותו במהירות מקסימלית על כרטיס מסך בודד, צריך לוודא שקובץ המודל קטן בלפחות גיגה או שניים מנפח הזיכרון הגרפי. הגרסה המומלצת לרוב השימושים היא Q4_K_M ששוקלת 8.99 גיגהבייט ומתאימה למעבדים גרפיים עם 12 או 16 גיגה זיכרון, בעוד גרסאות כמו Q6_K דורשות כבר מעל 12 גיגהבייט לקובץ עצמו. למי שמוגבל בזיכרון יש גרסאות IQ נמוכות שמגיעות עד 4.70 גיגהבייט, אך הן איטיות יותר על מעבדי אפל ולא נתמכות ב־Vulkan.

ההרצה מתבצעת ישירות בתוכנות כמו LM Studio או דרך llama.cpp, עם תבנית פרומפט ספציפית הכוללת תגיות מערכת, משתמש ועוזר ייעודיות. אם אין ברשותכם חומרה ייעודית עם זיכרון מספק, ההרצה על זיכרון המערכת בלבד תאט את קצב הפקת הטוקנים משמעותית, ושם עדיף לשקול שימוש ב־API מרוחק.

ollama run hf.co/bartowski/DeepSeek-R1-Distill-Qwen-14B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

31 קבצים במאגר, 273 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בדף המודל לא דווח רישיון כלל. המשמעות היא שאין הרשאה מפורשת לשימוש מסחרי, הפצה או שילוב במוצר תוכנה, ואי אפשר להסתמך עליו בסביבה עסקית בלי לבדוק קודם את תנאי הרישיון של מודל המקור מבית דיפסיק.

הרישיון המלא בעמוד המודל ↗