GPT
D

DeepSeek-V2.5-GGUF

קוד פתוח

bartowskiother2024-09-06

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת קווינטוט מקומית למודל הענק של DeepSeek, שמתאימה למי שרוצה להריץ מודל שיחה וכתיבת קוד עצמאי על חומרה ייעודית כבדה מאוד.

  • 1.8 TBמשקל הקבצים
  • 5,352הורדות בחודש
  • 43לייקים

מה זה

המאגר מכיל המרות שונות בפורמט GGUF שנוצרו באמצעות llama.cpp עם כיול imatrix. המודל מתמקד ביצירת טקסט, ומיועד להרצה בסביבות מקומיות כמו LM Studio או ישירות דרך מנועי הסקה תומכים.

ההבדל העיקרי מול מודלים קטנים יותר הוא הנפח. הגרסאות כאן נעות בין 52.68 ג'יגה בייט בגרסה המכווצת ביותר ועד 250.62 ג'יגה בייט בגרסת שמונה ביט מלאה, כך שלא מדובר במשהו שזורקים על מחשב נייד רגיל.

היוצר ממליץ על גרסת Q4_K_M במשקל 142.45 ג'יגה בייט כברירת מחדל לאיזון בין איכות לגודל, או על Q6_K במשקל 193.54 ג'יגה בייט כשרוצים איכות כמעט מושלמת בלי להתפשר.

מתאים ל

  • הסקה מקומית מאובטחת

    הרצה פנימית בארגון שאינו מוכן להוציא קוד או טקסט רגיש לשרתים חיצוניים.

  • בדיקות איכות על שרת פנימי

    השוואת ביצועי מודלים גדולים בסביבת בדיקות מקומית ללא תלות בעלויות פר טוקן.

  • פיתוח יישומים ללא אינטרנט

    שילוב יכולות שיחה וכתיבה במערכות מבודדות לחלוטין מרשת חיצונית.

איפה זה נופל

הבעיה המרכזית היא דרישות החומרה. ברמות הכיווץ הנמוכות שנועדו לחסוך מקום, כמו IQ1_M או סדרת Q2, איכות הפלט יורדת בצורה חדה והיוצר עצמו מסמן חלק מהן כלא מומלצות לשימוש.

בנוסף, שימוש בגרסאות ה־I-quant החדשות לא עובד על תשתית Vulcan, ובמעבדי אפל או CPU רגיל הן רצות לאט יותר מגרסאות K מקבילות. לפני שמתחייבים להרצה עצמית כדאי לבדוק אם מהירות התגובה בפועל עונה על הצרכים שלכם.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מהרשימה?

היוצר מסמן את Q4_K_M במשקל 142.45 ג'יגה בייט כבחירה הסטנדרטית לרוב השימושים. אם יש לכם מספיק זיכרון ואתם רוצים איכות מקסימלית, Q6_K עדיף, ואילו גרסאות ה־IQ נותנות מענה רק כשיש מחסור חמור במקום.

האם אפשר להריץ את זה על מחשב אישי רגיל?

לא. אפילו הגרסה הקטנה ביותר דורשת מעל 52 ג'יגה בייט של זיכרון פנוי רק כדי להיטען. מחשב שולחני סטנדרטי פשוט יקרוס מחוסר זיכרון.

איך מריצים

כדי להריץ אותו צריך שרת ייעודי עם נפח זיכרון עצום. הקובץ המומלץ, Q4_K_M, שוקל מעל 142 ג'יגה בייט, מה שדורש מערך של כמה כרטיסי מסך חזקים עם מעל 150 ג'יגה בייט של VRAM אם רוצים מהירות סבירה, או שילוב של זיכרון מערכת וכרטיס מסך שיגרום לו לרוץ לאט מאוד.

אם אין לכם שרת כזה זמין במשרד או בענן, עדיף פשוט לצרוך את המודל המקורי דרך API של ספק חיצוני. הקבצים מעל 50 ג'יגה בייט מחולקים לחלקים, ומורידים אותם באמצעות huggingface-cli ישירות לתיקייה מקומית.

ollama run hf.co/bartowski/DeepSeek-V2.5-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

63 קבצים במאגר, 1.8 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי דוגמת MIT או Apache. המשמעות היא שחובה לבדוק את תנאי השימוש המקוריים של חברת DeepSeek לפני שמשלבים את המודל במוצר מסחרי או מפיצים אותו ללקוחות.

הרישיון המלא בעמוד המודל ↗