GPT
D

DeepSeek-R1-0528-GGUF

קוד פתוח

unslothmit2025-05-28

  • transformers
  • gguf
  • deepseek_v3
  • text-generation
  • deepseek

גרסת GGUF מעודכנת של מודל החשיבה מבית דיפסיק, שמציגה זינוק ביכולות פתרון בעיות במתמטיקה ובקוד. היא מיועדת למי שמחפש היגיון עמוק במיוחד בתוך תשתית של llama.cpp.

  • 163,840טוקנים בהקשר
  • 10.0 TBמשקל הקבצים
  • 3,079הורדות בחודש
  • 202לייקים

מה זה

הגרסה הזו מייצגת עדכון למודל החשיבה של דיפסיק, שפותח כדי לחזק את עומק ההסקה הלוגית שלו. השינוי המרכזי מול הגרסה הקודמת מתבטא בהשקעת משאבי חישוב וטוקנים רבים יותר בכל שאלה. במבחן AIME 2025 הדיוק קפץ מ־70% ל־87.5%, כשהמודל מייצר בממוצע 23 אלף טוקנים של מחשבה לכל בעיה במקום 12 אלף בעבר. השיפור ניכר גם במבחני תכנות כמו LiveCodeBench שעלה מ־63.5 ל־73.3, ודירוג Codeforces שהגיע ל־1930.

בנוסף לחיזוק הלוגיקה, המודל כולל תמיכה בהפעלת כלים ובקריאות פונקציות, יחד עם הפחתה בשיעור ההזיות. ההבדל המעשי הוא שהמודל הזה חופר ומנתח בעיות באופן ממושך בהרבה מגרסאות קודמות באותו הגודל. ההרצה הזו מפיקה שרשרת חשיבה רחבה ומורכבת, שמאפשרת לו להתמודד בהצלחה עם אתגרי הנדסת תוכנה קשים, אך דורשת סבלנות וקיבולת פלט גבוהה.

מתאים ל

  • פתרון בעיות מתמטיקה

    מתאים להוכחות ואלגוריתמיקה כבדה בזכות יכולת לייצר עשרות אלפי טוקנים של הסקה מעמיקה לכל שאלה.

  • בדיקת באגים וקוד מורכב

    מציג 57.6% פתרון ב־SWE Verified, ולכן מתאים למשימות הנדסת תוכנה שדורשות הבנה מעמיקה של פרויקטים.

  • זיקוק מודלים פנימיים

    פלט החשיבה העשיר שלו מאפשר לאמן מודלים קטנים יותר בארגון, תחת תנאי רישיון MIT שמתיר זיקוק ישיר.

איפה זה נופל

המודל נופל בשאלות עובדתיות ישירות, ובמבחן SimpleQA הציון שלו אפילו ירד מ־30.1% בגרסה הקודמת ל־27.8%. כמו כן, הביצועים שלו במבחן הכלים BFCL עומדים על 37.0% בלבד, שזה ציון נמוך למדי שמחייב בדיקה קפדנית אם אתם בונים עליו לסוכנים אוטומטיים. החיסרון המשמעותי ביותר הוא זמן התגובה. כשהמודל מייצר עשרות אלפי טוקנים של מחשבה כדי לפתור שאלה אחת, הוא לא מתאים לממשקים שדורשים מהירות או אינטראקציה חיה עם משתמשים.

שאלות
נפוצות

האם אני צריך להוריד את כל 10 הטרה־בייט שמופיעים במאגר?

ממש לא. המאגר מכיל עשרות קובצי קוונטיזציה שונים של שיטת GGUF. אתם בוחרים ומורידים רק את קובץ הדיוק הספציפי שמתאים לכמות הזיכרון שיש לכם בשרת.

האם המודל דורש פרומפט מיוחד כדי שיתחיל לחשוב?

לא. בניגוד לגרסה המוקדמת, כאן לא צריך לדחוף תגית פתיחה ידנית כדי להפעיל את שרשרת המחשבה, ויש תמיכה מובנית בהנחיות מערכת.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־10 טרה־בייט ב־241 קבצים, מה שאומר שמדובר באוסף גרסאות ולא בקובץ יחיד שמורידים בשלמותו. להרצה מקומית ב־llama.cpp צריך לבחור את הקוונטיזציה שמתאימה לחומרה שלכם, להגדיר טמפרטורה של 0.6 ו־Top P של 0.95. המפרסמים מציינים שאין צורך להוסיף תגית פתיחה של חשיבה ידנית, ויש לדלג על טוקן תחילת המשפט בגלל הוספה אוטומטית.

אם אין לכם שרת ייעודי עם נפח זיכרון עצום ומערך מאיצים רחב שמתאים לארכיטקטורת המקור של דיפסיק, עדיף בהרבה להשתמש ב־API הרשמי שמציעה החברה. הרצה של מודל בסדר גודל כזה על חומרה מקומית רגילה תהיה איטית או בלתי אפשרית.

ollama run hf.co/unsloth/DeepSeek-R1-0528-GGUF:Q6_K_XL

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

241 קבצים במאגר, 10.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל והקוד מופצים תחת רישיון MIT. המשמעות היא שאתם יכולים להשתמש בו לצרכים מסחריים, להפיץ אותו, לבצע זיקוק של הידע למודלים קטנים יותר ולשלב אותו במוצרים שלכם ללא תשלום תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗