GPT
Q

Qwen3-235B-A22B-128K-GGUF

קוד פתוח

unslothapache-2.02025-04-28

  • transformers
  • gguf
  • qwen3_moe
  • text-generation
  • unsloth

גרסת GGUF למודל MoE ענק שמאפשרת להריץ חשיבה עמוקה או תשובות מהירות באותו בסיס קוד, תוך הפעלת חלק קטן מהמשקלים בכל פנייה.

  • 131,072טוקנים בהקשר
  • 2.8 TBמשקל הקבצים
  • 2,514הורדות בחודש
  • 38לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים שמחזיקה מאגר כולל של 235 מיליארד פרמטרים, אבל מפעילה רק 22 מיליארד בכל שלב יצירה. המבנה הזה מחלק את המשקלים בין 128 מומחים שונים ומשתמש בשמונה מהם בו זמנית, מה שמקצר את זמן החישוב ביחס למודלים צפופים בגודל דומה. הוא תומך בהרחבת חלון ההקשר מעבר לטווח הטבעי של 32,768 טוקנים עד ל־131,072 טוקנים באמצעות מנגנון YaRN.

החידוש המרכזי כאן הוא היכולת לדלג בין שני מצבי עבודה ללא טעינת משקלים מחדש. מצב החשיבה מייצר שלבי היסק מפורטים בתוך תגיות ייעודיות לפתרון בעיות היגיון, מתמטיקה ותכנות, בעוד שמצב רגיל מחזיר תשובות ישירות לשיחות יומיומיות, שילוב כלים חיצוניים ותרגום ליותר ממאה שפות.

מתאים ל

  • פתרון בעיות קוד והיגיון

    מצב החשיבה מפרק בעיות מורכבות לשלבים נפרדים לפני פליטת הפתרון הסופי.

  • הפעלת סוכנים וכלים חיצוניים

    ארכיטקטורת המומחים תומכת בחיבור קריאות פונקציה וממשקי MCP בשני מצבי העבודה.

  • עיבוד מסמכים ארוכים

    תמיכה בהקשר של עד 131 אלף טוקנים עם YaRN מתאימה לניתוח טקסטים נרחבים.

איפה זה נופל

המודל רגיש מאוד לפרמטרי הדגימה. שימוש ב־greedy decoding גורם לקריסה בביצועים וללולאות חזרתיות אינסופיות, ומחייב לעבוד עם טמפרטורה ספציפית וערכי TopP מוגדרים. בנוסף, הפעלת YaRN מבוססת על מקדם סטטי ברוב המנועים, מה שפוגע בדיוק ובביצועים דווקא בטקסטים קצרים אם מגדירים חלון עבודה גדול מדי מראש.

אותה משפחה

Qwen3 יצא ב־10 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מכבים את שלבי החשיבה הארוכים בפניות רגילות?

אפשר להגדיר enable_thinking כ־False ברמת ה־API, או להוסיף את הפקודות no_think ו־think ישירות בהודעות המשתמש כדי לשלוט בהתנהגות בכל תור שיחה.

למה התשובות חוזרות על עצמן בלולאה?

הכרטיס מזהיר במפורש שלא להשתמש ב־greedy decoding. יש לוודא שהטמפרטורה מכוונת ל־0.6 במצב חשיבה או 0.7 במצב רגיל, ובמידת הצורך להעלות את ה־presence penalty עד 2.

האם כדאי להפעיל תמיד את התמיכה ב־131K טוקנים?

לא. מנועי ההרצה משתמשים ב־YaRN סטטי שמוריד את איכות הפלט בטקסטים קצרים. מומלץ להפעיל את ההרחבה רק כשבאמת שולחים קלט ארוך שעובר את 32 אלף הטוקנים המקוריים.

איך מריצים

המשקל הכולל של כלל קובצי המאגר עומד על 2.8 טרה בייט, כך שאי אפשר להריץ אותו על שרת בודד פשוט. פריסה מקומית מלאה של קובצי ה־GGUF האלה דורשת חומרת שרתים כבדה בריבוי כרטיסי מסך ופיצול שכבות דרך מנועים כמו llama.cpp או SGLang ו־vLLM עם תמיכה ב־TP של לפחות 8.

אם אין לכם קלאסטר ארגוני ייעודי, עדיף להשתמש בנקודת קצה מנוהלת כמו Alibaba Model Studio שתומכת ב־YaRN דינמי מובנה בלי הצורך לתחזק אחסון עצום והקצאות זיכרון מורכבות.

ollama run hf.co/unsloth/Qwen3-235B-A22B-128K-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

78 קבצים במאגר, 2.8 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש חופשי, שינוי קוד, הפצה ושילוב במוצרים מסחריים ללא תשלום תמלוגים, בתנאי ששומרים על הודעות זכויות היוצרים וכתב הוויתור המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗