GPT
D

bartowski/DeepSeek-R1-GGUF

קוד פתוח

bartowskimit2025-01-21

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF מלאה של DeepSeek-R1 שנועדה להרצה מקומית דרך llama.cpp או LM Studio. מפתחים מורידים אותה כשהם חייבים יכולות חשיבה מתקדמות על שרתים פנימיים ללא תלות ברשת.

  • 7.2 TBמשקל הקבצים
  • 1,936הורדות בחודש
  • 106לייקים

מה זה

המאגר הזה מכיל המרות מכוילות בשיטת imatrix למודל DeepSeek-R1 המקורי, תוך שימוש בגרסה b4514 של llama.cpp ומעבר דרך בסיס BF16 של Arcee-AI. הוא נועד למשימות של יצירת טקסט ומענה מורכב, כשהייחוד שלו הוא דחיסת מודל ענק לפורמטים שונים שמאפשרים להריץ אותו ישירות על מעבדים וכרטיסים גרפיים ביתיים או ארגוניים ללא צורך במערך שרתים מסחרי שלם.

הקובץ כולל טווח רחב במיוחד של רמות כימות. מגרסת Q8_0 שתופסת 713.29GB ומציעה איכות מקסימלית כמעט ללא פשרות, דרך גרסאות ביניים מאוזנות כמו Q4_K_M במשקל 404.43GB, ועד דחיסות קיצוניות בטכנולוגיית IQ שיורדות עד 133.56GB. הטבלאות בכרטיס ממחישות ששימוש בכימותים ייעודיים מאפשר פריקה מהירה יותר במעבדי ARM ו־AVX הודות למנגנון סידור מחדש של משקולות בזמן ריצה. זה אומר שבמעבדים תואמים מקבלים קצב עיבוד פרומפטים מהיר יותר, בלי לנעול את המודל לפורמטים ישנים שכבר אינם נתמכים.

מתאים ל

  • הרצה מקומית מאובטחת

    מתאים לארגונים שמחזיקים שרתי ענק עם חצי טרה זיכרון ורוצים להריץ מודל חזק בלי להוציא מידע לרשת.

  • הסקה על מעבדי ARM

    גרסאות Q4_0 ו־IQ4_NL מתאימות למי שמשתמש במעבדי שרת מבוססי ARM וצריך טעינה וסידור מחדש של משקולות בזמן ריצה.

  • בדיקות איכות בכימותים

    מפתחי תשתיות LLM יכולים להשוות בין שיטות הדחיסה השונות, מ־8 ביט ועד IQ1, כדי למדוד איבוד דיוק מול זיכרון.

איפה זה נופל

החיסרון המרכזי כאן הוא הפגיעה הקשה באיכות בגרסאות הנמוכות. הכרטיס מציין במפורש שגרסאות IQ1_S ו־IQ1_M הן באיכות נמוכה ביותר ואינן מומלצות לשימוש, וגם גרסאות ה־2 ביט וה־3 ביט סובלות מירידה מורגשת בדיוק. בנוסף, קובצי ה־I-quants לא עובדים עם מאיצי Vulkan של AMD, והרצה שלהם על מעבד רגיל או Apple Metal תהיה איטית יותר בהשוואה לגרסאות K רגילות. לפני שמשלבים גרסה מכווצת במוצר, חובה לבדוק שהתשובות לא מתעוותות בגלל הכימות האגרסיבי.

שאלות
נפוצות

איזו גרסה כדאי להוריד אם יש לי מספיק זיכרון?

ההמלצה הרשמית בכרטיס לרוב השימושים היא Q4_K_M ששוקלת 404.43GB. אם יש לכם שרת עצום עם יותר מ־600GB זיכרון פנוי, גרסת Q6_K תיתן איכות כמעט מושלמת, בעוד ש־Q8_0 נחשבת מיותרת בגלל גודל של מעל 713GB.

האם המודל ירוץ על כרטיס גרפי של AMD?

כן, אבל רק אם אתם עובדים עם סביבת rocBLAS. הכרטיס מציין שגרסאות ה־I-quants החדשות אינן נתמכות במנוע Vulkan, כך שמשתמשי AMD צריכים לבדוק היטב את תאימות הדרייברים לפני ההורדה.

איך מריצים

בשביל להריץ את המודל הזה צריך חומרה כבדה מאוד. הגרסה הקטנה והמומלצת לשימוש כללי, Q4_K_M, שוקלת 404.43GB, כך שתצטרכו שרת עם מאות ג'יגה בייט של זיכרון RAM או מערך כרטיסי מסך מרובה VRAM כדי לטעון אותה במלואה. מריצים את הקבצים ישירות ב־llama.cpp או דרך תוכנת LM Studio, תוך הקפדה על פורמט הפרומפט המוגדר שכולל תגיות begin_of_sentence, User ו־Assistant.

מי שאין לו שרת ייעודי כזה בחברה יתקשה מאוד להפיק ממנו תועלת. אם אתם עובדים על מחשב נייד או תחנת עבודה רגילה, עדיף בהרבה לקרוא ל־API חיצוני של המודל במקום לנסות להוריד מאות ג'יגה בייט ולהריץ סימולציה איטית על מעבד.

ollama run hf.co/bartowski/DeepSeek-R1-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

219 קבצים במאגר, 7.2 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המאגר מפורסם תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי, שינוי, הפצה ושילוב במוצרים סגורים בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗