GPT
D

DeepSeek-R1-GGUF

קוד פתוח

unslothmit2025-01-20

  • transformers
  • gguf
  • deepseek_v3
  • text-generation
  • deepseek

גרסת GGUF מכווצת של מודל ההסקה DeepSeek-R1, שנועדה לאפשר הרצה מקומית של ענק ה־671 מיליארד פרמטרים. היא פונה למי שרוצה ביצועי חשיבה ברמת OpenAI-o1 על חומרה נגישה יותר.

  • 163,840טוקנים בהקשר
  • 4.8 TBמשקל הקבצים
  • 28,983הורדות בחודש
  • 1,116לייקים

מה זה

מדובר בהמרה של DeepSeek-R1 לקובצי GGUF באמצעות כימות דינמי של 1.58 עד 2.51 ביט מבית Unsloth. המודל המקורי בנוי בארכיטקטורת תערובת מומחים (MoE) עם 671 מיליארד פרמטרים בסך הכול, אך מפעיל רק 37 מיליארד פרמטרים בכל טוקן, מה ששומר עליו מהיר יחסית לגודלו העצום.

במבחני ביצועים, המודל המלא מציג תוצאות שמתחרות ישירות ב־OpenAI-o1, עם 79.8% ב־AIME 2024 וציון של 97.3% ב־MATH-500. הכימות של Unsloth שומר על דיוק השכבות הקריטיות ומכווץ חזק יותר את שכבות ה־MoE, מה שמאפשר לצמצם את דרישות הזיכרון בלי לשבור את יכולת פתרון הבעיות הרב שלבי.

מתאים ל

  • פתרון בעיות מתמטיקה

    משיג 97.3% במבחן MATH-500 בזכות שרשרת חשיבה מעמיקה לפני מענה.

  • תכנות ודיבאגינג מורכב

    מחזיק בדירוג תחרותי של 2029 ב־Codeforces ופותר בעיות אלגוריתמיות קשות.

  • הסקה לוגית עצמאית

    מבצע אימות עצמי ותיקון שגיאות בזמן אמת ללא צורך בהנחיה מוקדמת.

איפה זה נופל

המודל פגיע מאוד לחזרתיות בלתי נגמרת ופלט מקוטע אם חורגים מההגדרות המומלצות. חובה לעבוד בטמפרטורה של 0.5 עד 0.7, ועדיף להוסיף את הדגל min-p 0.05 כדי למנוע בחירת טוקנים שגויים בגרסאות ה־1.58 ביט. אסור להשתמש ב־System Prompt רגיל, שכן כל ההנחיות חייבות להיכנס ישירות לתוך ה־User Prompt כדי שהמודל לא יאבד כיוון.

אותה משפחה

DeepSeek-R1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כרטיס מסך ביתי בודד של 24 גיגה-בייט מספיק להרצה?

לא להרצה מלאה. הכרטיס יאחסן רק כ־7 שכבות מתוך 61, ושאר המודל יישב על זיכרון המחשב הראשי, מה שיוביל לביצועים איטיים מאוד.

איזו גרסת כימות הכי כדאי להוריד מתוך המאגר?

גרסת UD-IQ1_M בנפח 158 גיגה-בייט מציעה איזון טוב בין נפח לדיוק. אם הנפח מוגבל מאוד, גרסת UD-IQ1_S תדרוש רק 131 גיגה-בייט אך תאבד מעט חדות.

האם המודל דורש פורמט קלט מסוים בהרצה?

כן, חובה להשתמש בטוקנים התוחמים של המשתמש והעוזר, ולהכניס את כל הוראות המערכת בתוך פניית המשתמש עצמה ללא System Prompt נפרד.

איך מריצים

להרצה מקומית משתמשים בגרסה עדכנית של llama.cpp שתומכת בכימותים הדינמיים. הגרסה הקלה ביותר, UD-IQ1_S, תופסת 131 גיגה-בייט על הדיסק, בעוד שגרסת UD-Q2_K_XL האיכותית יותר דורשת 212 גיגה-בייט. גם אחרי הכיווץ האגרסיבי דרוש מחשב עם לפחות 150 עד 250 גיגה-בייט של זיכרון משולב, כמו תחנות עבודה מרובות כרטיסי מסך או מחשבי Mac עם זיכרון מאוחד גבוה.

אם יש לכם כרטיס בודד כמו RTX 4090 עם 24 גיגה-בייט זיכרון, תוכלו להוריד אליו רק כ־7 שכבות מתוך 61 ולבצע את שאר החישובים על המעבד, מה שיוביל לקצב יצירה איטי. בהיעדר שרת ייעודי כבד, עדיף להשתמש ב־API הרשמי של DeepSeek במקום להילחם בחומרה מקומית.

ollama run hf.co/unsloth/DeepSeek-R1-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

118 קבצים במאגר, 4.8 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. המשמעות היא חופש מלא לשימוש מסחרי, שינוי הקוד, הרצה פרטית והפצה מחדש, כולל שימוש בפלט של המודל כדי לזקק מודלים אחרים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים המקורית של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗