GPT
Q

Qwen3-235B-A22B-Thinking-2507-GGUF

קוד פתוח

unslothapache-2.02025-07-25

  • transformers
  • gguf
  • qwen
  • qwen3
  • unsloth

מודל חשיבה פתוח במשקל כולל של 235 מיליארד פרמטרים שמפעיל רק 22 מיליארד בכל טוקן. הוא נבנה לפתרון בעיות תכנות ומתמטיקה קשות במיוחד.

  • 3.0 TBמשקל הקבצים
  • 2,122הורדות בחודש
  • 84לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים הכוללת 128 מומחים, שמתוכם 8 פעילים בכל רגע נתון. המודל מגיע עם חלון הקשר מובנה של 262,144 טוקנים, ותומך אך ורק במצב חשיבה עם שרשרת מחשבה מפורטת דרך תגיות ייעודיות.

במבחני הביצועים הוא עוקף מודלים מובילים בחלק מהמדדים המורכבים. בבדיקת LiveCodeBench v6 הוא רשם ציון 74.1, ובמבחן המתמטיקה HMMT25 הגיע ל 83.9, שניהם מעל OpenAI O3 ומתחרים בקוד פתוח. מצד שני, במבחני סוכנים ספציפיים כמו הזמנות טיסה ב TAU2 הוא נעצר ב 58.0 לעומת 70.0 של O3, כך שהיתרון שלו בולט בעיקר בפתרון בעיות לוגיות מוגדרות ולאו דווקא באינטראקציה שירותית.

מתאים ל

  • פתרון בעיות תכנות תחרותי

    המודל קיבל 2134 במבחן CFEval ומתאים לפיצוח אלגוריתמים מורכבים הדורשים בדיקה מעמיקה.

  • הוכחות וחישובים במתמטיקה

    עם תוצאה של 92.3 במבחן AIME25, הוא מפיק שרשראות הוכחה מפורטות ללא קיצורי דרך.

  • ניתוח קוד בפרויקטים ארוכים

    חלון הקשר מלא של 256K מאפשר לטעון תיעוד נרחב וקבצי מקור רבים לצורך איתור באגים.

איפה זה נופל

החיסרון המרכזי הוא חוסר הגמישות. המודל מחויב במצב חשיבה ואי אפשר לבטל את הפקת שרשרת המחשבה למענה מיידי. הוא מייצר פלט ארוך מאוד שיכול להגיע עד 81,920 טוקנים, מה שגורר זמני השהיה ארוכים ותפיסת משאבים חריגה. בנוסף, העלאת פרמטר presence_penalty כדי למנוע חזרתיות עלולה לגרום לערבוב שפות ולפגיעה באיכות.

שאלות
נפוצות

אפשר לבטל את מנגנון החשיבה כדי לקבל תשובות מהירות?

לא. המודל הוגדר ותומך רק במצב חשיבה. תבנית השיחה מוסיפה אוטומטית פתיחת תגית חשיבה לכל שאילתה, והוא תמיד יעבור שלב ניתוח פנימי לפני הפלט הסופי.

מה צריך לעשות עם שרשרת המחשבה בשיחות מרובות שלבים?

התיעוד מנחה לנקות את תוכן החשיבה מההיסטוריה ולהשאיר בזיכרון השיחה רק את התשובה הסופית. השארת שלבי החשיבה בהיסטוריה פוגעת בדיוק של המודל ומבזבזת זיכרון לחינם.

איך מריצים

קובצי ה GGUF המלאים במאגר שוקלים יחד שלושה טרה בייט עבור כלל הגרסאות, כך שאתם מורידים רק את הכימות הרלוונטי. פריסה מקומית דורשת שרת ייעודי כבד. ההמלצה של המפתחים בהרצה דרך vLLM או SGLang היא חלוקה על פני 8 מעבדים גרפיים במקביל כדי להחזיק את המשקלים ואת חלון ההקשר המלא.

אם אתם לא מחזיקים אשכול של שמונה כרטיסים מקצועיים, עדיף להשתמש ב API חיצוני שסולק את המודל. אפשר לצמצם את ההקשר בעת מחסור בזיכרון, אבל מומלץ להישאר מעל 131,072 טוקנים כדי לתת למודל מספיק מקום לחשוב.

ollama run hf.co/unsloth/Qwen3-235B-A22B-Thinking-2507-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

78 קבצים במאגר, 3.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי קוד, והפצה עצמאית. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗