GPT
D

unsloth/DeepSeek-R1-0528-Qwen3-8B-GGUF

קוד פתוח

unslothmit2025-05-29

  • transformers
  • gguf
  • qwen3
  • text-generation
  • unsloth

זיקוק תהליכי חשיבה של מודל ענק לתוך בסיס קומפקטי מייצר פתרון חזק למשימות היגיון. הוא נותן ביצועי מתמטיקה ותכנות שחריגים לגודלו בלי לשלם בחומרה כבדה.

  • 131,072טוקנים בהקשר
  • 129 GBמשקל הקבצים
  • 53,481הורדות בחודש
  • 445לייקים

מה זה

המודל מבוסס על הארכיטקטורה של Qwen3 עם 8 מיליארד פרמטרים, אבל עבר אימון על שרשראות החשיבה של DeepSeek-R1-0528. במקום להסתפק ביכולות המקוריות של משקל קל, הוא מחקה את צורת הניתוח של מודלים גדולים בהרבה, וזה מורגש ישירות במבחנים הקשים.

במבחן המתמטי AIME 2024 הוא מגיע לציון 86, וב־AIME 2025 ל־76.3. המשמעות המעשית היא שבמשימות אלגוריתמיות וחישובים מורכבים הוא מנצח את רוב הכלים בסדר הגודל שלו ומתחרה במודלים של עשרות ומאות מיליארדי פרמטרים. בתכנות הוא עומד על 60.5 ב־LiveCodeBench, שזה נתון יפה לגודל כזה, אם כי הוא לא מחליף כלי פיתוח מלאים.

מתאים ל

  • פתרון בעיות מתמטיות

    מגיע ל־86 אחוז ב־AIME 2024 בזכות זיקוק שרשראות חשיבה ארוכות מגודל ענק.

  • הסקה מקומית על חומרה צנועה

    פורמט GGUF מאפשר להריץ מודל היגיון של 8 מיליארד פרמטרים על מחשב יחיד.

  • עבודה עם פרומפטים מובנים

    תומך ב־system prompt רשמי ומאפשר ניתוח מסמכים או חיפוש לפי תבניות ייעודיות.

איפה זה נופל

במבחן הידע הכללי GPQA Diamond המודל מקבל ציון 61.1, ובמדד LiveCodeBench הוא עוצר על 60.5. המספרים האלה מראים שהוא נופל מול מודלים מסחריים סגורים כשהשאלות דורשות הבנה רחבה או כתיבת קוד יישומי מורכב. הוא ממוקד בהיגיון ומדעים מדויקים, ולא מתאים כפתרון לכל משימה.

שאלות
נפוצות

האם צריך להכריח אותו לחשוב עם תגית ייעודית?

בגרסה הזו אין צורך להוסיף את תגית החשיבה בתחילת הפלט כדי להפעיל את הניתוח המעמיק. המודל נכנס לתהליך ההיגיון באופן טבעי לפי הפרומפט ומשתמש בתבנית השיחה הרגילה של R1.

האם המודל מתאים לפיתוח תוכנה מורכב?

הוא מתמודד יפה עם בעיות קוד אלגוריתמיות אבל מגיע ל־60.5 בלבד ב־LiveCodeBench. למערכות גדולות או פיתוח מורכב עדיף לבחור במודל ייעודי או במודל המקורי המלא.

איך מריצים

קובץ המשקלים הכולל שוקל 129 גיגה בייט ב־32 קבצים ומכיל גרסאות שונות בפורמט GGUF, כשהרצה פשוטה אפשרית ישירות דרך פקודת ollama run עם גרסת Q4_K_XL. ההרצה דורשת כרטיס מסך ביתי סביר או זיכרון מערכת מספק בהתאם לכיול שבחרתם, והמפרסמים ממליצים לעבוד ב־llama.cpp בלי תגית פתיחת משפט ידנית כי היא מתווספת לבד.

הגדרות ההסקה קריטיות ליציבות: צריך לקבע את ה־temperature לטווח של 0.5 עד 0.7, כשההמלצה הרשמית היא 0.6, לצד Top_P של 0.95 כדי לצמצם חזרתיות. אם אתם צריכים רק שאילתות בודדות או תשובות מהירות בלי להחזיק תשתית, עדיף להשתמש ב־API הרשמי של DeepSeek במקום להשקיע משאבים בשרת מקומי.

ollama run hf.co/unsloth/DeepSeek-R1-0528-Qwen3-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא MIT מלא. מותר להשתמש בו לצרכים מסחריים, להטמיע אותו בתוך מוצרים, לשנות אותו ואף לבצע זיקוק של הידע שלו למודלים אחרים בלי דרישות מיוחדות חוץ משמירה על תנאי הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗