GPT
Q

Qwen3.5-397B-A17B-GGUF

קוד פתוח

unslothapache-2.02026-02-16

  • transformers
  • gguf
  • qwen3_5_moe
  • image-text-to-text
  • unsloth

גרסת MoE ענקית שמשלבת קלט תמונה וטקסט עם חלון של רבע מיליון טוקנים. היא מפעילה רק 17 מיליארד פרמטרים מתוך כמעט 400 מיליארד בכל שלב.

  • 262,144טוקנים בהקשר
  • 6.7 TBמשקל הקבצים
  • 396,008הורדות בחודש
  • 253לייקים

מה זה

מדובר במודל רב מודלי שמקבל תמונות וטקסט ופולט טקסט. המבנה שלו מבוסס על תערובת מומחים של 512 מומחים בסך הכול, כשבכל צעד מופעלים רק עשרה מנותבים ואחד משותף, לצד שילוב של Gated DeltaNet ורשתות קשב. הרעיון כאן הוא לקבל יכולת של מודל ענק עם עלות חישובית של מודל בינוני בזמן הריצה.

במדדי ההוראות והסוכנים הוא עומד יפה מול הגדולים. ב־IFBench הוא הגיע ל־76.5 וב־MultiChallenge קיבל 67.6, שניהם מעל מודלים כמו GPT5.2 או Gemini-3 Pro. במבחני סוכנים כמו BFCL-V4 הוא רשם 72.9 לעומת 63.1 של GPT5.2. מנגד, במתמטיקה כבדה ומבחני קיצון כמו HLE הוא נשאר מאחור עם 28.7 בלבד, וב־LiveCodeBench v6 הוא הגיע ל־83.6 לעומת מעל 87 אצל המובילים.

מתאים ל

  • הפעלת סוכנים אוטונומיים

    התוצאות במדדי BFCL ו־MultiChallenge מראות יכולת גבוהה בקריאת כלים וביצוע רצף פקודות מורכב.

  • ניתוח מסמכים חזותיים ארוכים

    קלט תמונה לצד חלון של 262,144 טוקנים מאפשר לעבד דוחות מרובי תרשימים וספרים סרוקים שלמים.

  • אירוח עצמי בסביבה מבודדת

    רישיון אפאצ'י מאפשר להקים שרת פרטי לחלוטין בארגונים שלא מורשים להוציא מידע ל־API חיצוני.

איפה זה נופל

החולשה העיקרית נחשפת ברגע שדוחפים אותו למשימות חשיבה קיצוניות. במדד HLE הוא קיבל 28.7, הציון הנמוך בטבלה בהשוואה למתחרים שנמצאים סביב 35 ו־37. גם במדד התכנון DeepPlanning הוא עצר ב־34.3 מול 44.6 של GPT5.2. נקודה טכנית קריטית היא מנגנון החשיבה הפנימי, שאם רוצים לבטל אותו כדי לחסוך זמן פלט צריך להעביר פרמטר ייעודי בתבנית הצ'אט. בנוסף, חלון ההקשר המלא של מיליון טוקנים לא מגיע כברירת מחדל בקבצים האלה אלא דורש הרחבה, לעומת 262,144 הטבעיים.

אותה משפחה

Qwen3.5 יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על מחשב מקומי או תחנת עבודה רגילה?

לא. מדובר ב־397 מיליארד פרמטרים שדורשים כמות עצומה של זיכרון גרפי רק כדי להיטען, עוד לפני החישוב עצמו. גם עם אופטימיזציות של Unsloth, נדרש שרת ייעודי של כמה כרטיסים חזקים.

איך מבטלים את מנגנון החשיבה המובנה אם רוצים לקצר את זמני התגובה?

הכרטיס מציג פקודה ייעודית לתבנית הצ'אט שבה מעבירים את הערך false למשתנה enable_thinking. ביטול המנגנון חוסך יצירת טוקנים מיותרת של תהליך ההסקה.

איך מריצים

הריפוזיטורי הזה כולל קובצי משקלים בנפח כולל של 6.7 טרה בייט שמחולקים ל־198 קבצים, והוא מותאם לספריות כמו transformers, vLLM ו־SGLang. כדי להחזיק מודל של 397 מיליארד פרמטרים בזיכרון, אפילו אם רק 17 מופעלים בפועל, אתם צריכים שרת ייעודי מרובה כרטיסי מסך חזקים מאוד עם מאות גיגה בייט של VRAM, או מערך עבודה שמסוגל להתמודד עם שטח דיסק וזיכרון עצומים.

אם אין לכם חדר שרתים או קלאסטר ארגוני זמין, אין שום הגיון כלכלי או טכני לנסות לארח אותו לבד. המפתחים עצמם מציינים שהגרסה המנוהלת שנקראת Qwen3.5-Plus זמינה דרך ה־API של עליבאבא קלאוד, שם היא מגיעה כברירת מחדל עם חלון מורחב של מיליון טוקנים וכלים מובנים.

ollama run hf.co/unsloth/Qwen3.5-397B-A17B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

198 קבצים במאגר, 6.7 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, הפצה ושילוב בתוך מוצרים מסחריים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובת שחרור של הקוד שפיתחתם סביבו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗