GPT
Q

Qwen3-30B-A3B-Thinking-2507-GGUF

קוד פתוח

unslothapache-2.02025-07-29

  • transformers
  • gguf
  • qwen
  • qwen3
  • unsloth

גרסת MoE מכוילת לחשיבה ארוכה שמפעילה רק 3.3 מיליארד פרמטרים מתוך 30.5 בכל שלב. מתאימה למי שרוצה ביצועי הסקה וקוד גבוהים בלי לתחזק שרת כבד במיוחד.

  • 472 GBמשקל הקבצים
  • 1,324,084הורדות בחודש
  • 149לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים עם 128 מומחים בסך הכול, כשבכל טוקן פועלים 8 בלבד. המבנה הזה נותן מהירות חישוב של מודל קטן עם בסיס ידע של 30 מיליארד פרמטרים. הדגש המרכזי כאן הוא חשיבה מאומצת ומובנית כברירת מחדל, עם תמיכה מובנית בחלון הקשר של 262,144 טוקנים.

במדדי ההסקה המספרים מראים קפיצה ברורה מול הדור הקודם. במבחן AIME25 המודל הגיע לציון 85, ובמדד LiveCodeBench לציון 66, תוצאות שעוקפות גם מודלים גדולים בהרבה כמו גרסת ה־235 מיליארד באותו מבחן. הוא גם מציג שיפור בהפעלת כלים ובמדדי סוכנים כמו BFCL-v3 עם ציון 72.4.

מתאים ל

  • פתרון בעיות קוד מורכבות

    משיג 66 ב־LiveCodeBench ומסוגל להחזיק תהליך ניתוח ארוך של עשרות אלפי טוקנים.

  • סוכנים מבוססי כלים

    מציג ביצועים טובים במבחני BFCL ומתחבר ישירות להגדרות MCP ולספריות קריאת כלים.

  • ניתוח מסמכים ארוכים

    תומך בהקשר מובנה של עד 262,144 טוקנים ללא צורך בהתאמות מיוחדות.

איפה זה נופל

המודל פועל אך ורק במצב חשיבה. אי אפשר לבטל את שרשרת המחשבה, מה שאומר שכל תשובה כוללת תהליך פנימי ארוך ומייצרת השהיה ראשונית מורגשת לפני שהמשתמש מקבל פלט. הוא אינו מתאים למענה מהיר בזמן אמת.

בנוסף, כדי למנוע חזרתיות בלולאה היוצרים ממליצים להעלות את מקדם ה־presence penalty, אבל מזהירים שזה עלול לגרום לערבוב שפות ולפגיעה קלה באיכות. יש לוודא שהמערכת שלכם חותכת את תוכן המחשבה מההיסטוריה בשיחות מרובות שלבים, אחרת ההקשר מתמלא מהר מאוד.

שאלות
נפוצות

האם אפשר להשתמש בו לצ'אט רגיל ומהיר?

לא מומלץ. המודל מוגדר לחשוב לפני כל מענה ואין אפשרות לכבות את זה בהגדרות. הוא ייצר אלפי טוקנים של הסקה גם לשאלות פשוטות, מה שיעלה את זמני ההמתנה של המשתמש.

איך מטפלים בהיסטוריית שיחה בלי לחרוג מהזיכרון?

צריך לשמור בהיסטוריה רק את התשובה הסופית ולמחוק את כל מה שנמצא בתגיות החשיבה. תבנית ברירת המחדל עושה את זה לבד, אבל בהטמעה עצמאית תצטרכו לנקות את הטוקנים האלה ידנית כדי למנוע עומס על הזיכרון.

איך מריצים

המודל דורש גרסת transformers מ־4.51.0 ומעלה, אחרת תקבלו שגיאת תאימות. אפשר לפרוס אותו לשרת פנימי דרך vLLM או SGLang עם המפענח deepseek-r1, או להריץ אותו מקומית דרך llama.cpp, Ollama ו־LMStudio. המאגר כולל 472 גיגה־בייט המחולקים ל־33 קבצי GGUF, כך שבוחרים רק את הקובץ המתאים לקוונטיזציה הרצויה ולא מורידים את הכל.

ההפעלה של 30 מיליארד פרמטרים בזיכרון דורשת כרטיס מסך מודרני, במיוחד אם רוצים לנצל את חלון ההקשר המלא שמנפח במהירות את זיכרון ה־KV. מי שרוצה הקשר מלא של 256 אלף טוקנים ולא מחזיק חומרה עם עשרות גיגות של זיכרון גרפי, יסבול מקריסות מחוסר זיכרון ויעדיף להשתמש ב־API מוכן.

ollama run hf.co/unsloth/Qwen3-30B-A3B-Thinking-2507-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

33 קבצים במאגר, 472 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗