GPT
Q

Qwen3-235B-A22B-Instruct-2507-GGUF

קוד פתוח

unslothapache-2.02025-07-21

  • transformers
  • gguf
  • unsloth
  • qwen3
  • qwen

גרסת MoE ענקית שרצה עם 22 מיליארד פרמטרים פעילים בלבד בכל טוקן, ומיועדת למי שצריך ביצועים ברמה הגבוהה ביותר בלי להמתין לחשיבה איטית.

  • 3.0 TBמשקל הקבצים
  • 10,452הורדות בחודש
  • 119לייקים

מה זה

מדובר במודל שפה מבוסס תערובת מומחים עם 235 מיליארד פרמטרים בסך הכל, שמפעיל שמונה מתוך 128 מומחים בכל שלב. ההבדל הבולט כאן הוא שמדובר בגרסת הוראות ישירה שאינה מייצרת בלוקים של חשיבה, כך שהתשובה מגיעה מיד ללא שלבי ביניים. המודל תומך בחלון הקשר מקורי של 262,144 טוקנים.

במבחני הביצועים של הכרטיס, הגרסה הזו מציגה תוצאות חזקות במיוחד מול מודלים מובילים אחרים, כולל 70.3 במבחן המתמטי AIME25 וציון של 51.8 בקידוד ב־LiveCodeBench. במבחני הבנת משימות והוראות כמו Arena-Hard v2 הוא מגיע לציון 79.2, ומציג שיפור ברור בידע כללי ורב־לשוני לעומת גרסאות קודמות של אותה ארכיטקטורה.

מתאים ל

  • פתרון בעיות מתמטיקה

    מציג ציון של 70.3 ב־AIME25, מה שמאפשר מענה מדויק על חישובים מורכבים ללא צורך בהפעלת מצב חשיבה ארוך.

  • ניתוח מסמכי ענק

    תומך בחלון הקשר של עד 262,144 טוקנים, מתאים לסריקת תיעוד טכני נרחב או קובצי קוד שלמים.

  • הפעלת סוכנים וכלים

    מגיע עם תמיכה מובנית בחיבור כלים וציון 70.9 ב־BFCL-v3 להרצת פונקציות ברצף תהליכי עבודה.

איפה זה נופל

הבעיה המרכזית היא דרישות הזיכרון הקיצוניות בהקשר מלא. הרצה ב־256K טוקנים תגרום בקלות לשגיאות מחסור בזיכרון, והתיעוד עצמו ממליץ לקצץ את ההקשר ל־32,768 טוקנים כדי לשרוד.

בנוסף, אם תעלו את ה־presence penalty מעל אפס כדי למנוע חזרתיות, הכרטיס מזהיר במפורש מפני ירידה בביצועים וערבוב בין שפות שונות בפלט.

שאלות
נפוצות

איך מבטלים את פלטי החשיבה של המודל?

אין צורך לבטל אותם. המודל אומן מראש ללא מצב חשיבה, הוא אינו מייצר תגיות think כלל, ואין צורך להגדיר פרמטרים מיוחדים כדי לקבל תשובה ישירה.

מדוע המודל מתחיל לערבב אנגלית ועברית בתשובה?

הכרטיס מציין שהעלאת ערך ה־presence penalty כדי למנוע חזרות גורמת לעיתים קרובות לערבוב שפות. אם זה קורה, מומלץ להחזיר את הערך לאפס.

האם אפשר להריץ את המודל על מחשב מקומי רגיל?

לא. מדובר במודל של 235 מיליארד פרמטרים שדורש שרת ייעודי מרובה כרטיסי מסך, גם כאשר משתמשים בגרסאות GGUF מכווצות.

איך מריצים

המאגר הזה כולל 79 קבצים במשקל כולל של 3.0 טרה־בייט, שכוללים מימושי GGUF שונים מבית Unsloth. כדי להריץ משקלים בסדר גודל כזה, תצטרכו שרת עם מערך של שמונה כרטיסי מסך חזקים במקביל, כפי שממליצות פקודות ההרצה עם Tensor Parallel שמוגדר ל־8 בספריות כמו vLLM או SGLang. נדרשת גרסת transformers מ־4.51.0 ומעלה כדי שהקוד יזהה את הארכיטקטורה.

אם אין לכם אשכול שרתים ייעודי עם מאות גיגה־בייט של זיכרון גרפי זמין, אין שום הגיון כלכלי או טכני לנסות להריץ אותו עצמאית. במקרה כזה עדיף לפנות ישירות ל־API חיצוני שמחזיק את המודל על חומרה מתאימה.

ollama run hf.co/unsloth/Qwen3-235B-A22B-Instruct-2507-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

79 קבצים במאגר, 3.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗