GPT
Q

Qwen3.5-35B-A3B-AWQ-4bit

קוד פתוח

cyankiwiapache-2.02026-02-25

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

גרסת קוונטיזציה של מודל ראייה ושפה הפועל בארכיטקטורת תערובת מומחים. הוא מחזיק 35 מיליארד פרמטרים אך מפעיל רק 3 מיליארד בכל טוקן לקבלת מהירות גבוהה.

  • 37Bפרמטרים
  • 262,144טוקנים בהקשר
  • 22.8 GBמשקל הקבצים
  • 19,688הורדות בחודש

מה זה

מדובר במודל שמשלב קלט טקסט ותמונה בארכיטקטורת תערובת מומחים, שעבר כיווץ לפורמט AWQ בארבע ביט על ידי cyankiwi. הבסיס כולל 256 מומחים שמתוכם פועלים שמונה מומחים מנותבים ואחד משותף בכל רגע נתון. שילוב של שכבות Gated DeltaNet עם מנגנוני תשומת לב מספק תפוקת טוקנים מהירה יחסית למודלים בגודל מלא.

במדדי ההערכה של שפת הקוד והחשיבה הוא מתחרה היטב בדגמים צפופים. במבחן LiveCodeBench v6 הוא הגיע לציון 74.6, ובמבחן SWE-bench Verified השיג 69.2 אחוז. במשימות הפעלת כלים וסוכנים כמו TAU2-Bench הוא רשם תוצאה של 81.2 נקודות, שגוברת על חלק מהמודלים הגדולים יותר בסדרה.

מתאים ל

  • סוכני שיחה וקריאת כלים

    התוצאה ב־TAU2-Bench מגיעה ל־81.2, מה שמתאים להפעלת ממשקי פונקציות מהירים.

  • הבנת תמונות על כרטיס בודד

    משקל של 22.8 גיגה מאפשר עיבוד קלט חזותי וטקסטואלי במקביל על RTX 4090 ביתי.

  • פתרון משימות קוד מקומי

    ציון 69.2 ב־SWE-bench מאפשר שילוב כעוזר פיתוח מקומי לתיקון תקלות בקוד.

איפה זה נופל

למרות היכולת התאורטית לעבד רצפים ארוכים מאוד, במבחני Long Context יש ירידה בביצועים. במבחן AA-LCR הוא השיג 58.5 נקודות לעומת יותר מ־66 נקודות בגרסאות הצפופות והגדולות, כך שהוא פחות מדויק בשליפת פרטים מקבצים ענקיים.

גם במשימות תכנון מורכבות כמו VITA-Bench הציון עומד על 31.9 בלבד. בנוסף מדובר בהמרה שבוצעה על ידי משתמש קהילה ולא בערוץ הרשמי, כך שחובה לבדוק איכות פלט מול מודל המקור לפני שילוב שלו במערכת ייצור.

אותה משפחה

Qwen3.5 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי יחיד?

כן, המשקל הכולל של 22.8 גיגה בייט נכנס לתוך כרטיס עם 24 גיגה בייט זיכרון. עם זאת, במצב זה לא תוכלו לנצל את מלוא חלון ההקשר הארוך בגלל מגבלות זיכרון ה־KV הנוסף.

מה ההבדל בין 35B פרמטרים ל־3B פרמטרים פעילים?

הרשת שומרת בזיכרון את כל 35 מיליארד הפרמטרים, אך עבור כל טוקן שנוצר היא משתמשת רק בחלק קטן מהם. התוצאה היא מהירות ריצה של מודל קטן עם דיוק וידע של מודל גדול.

האם המודל כולל תמיכה בקלט של תמונות?

כן, המודל מאומן כמודל ראייה ושפה מאוחד ומטפל בקלט משולב של תמונה וטקסט ישירות, ללא צורך במודל נפרד לפענוח התמונה.

איך מריצים

כדי להריץ את קובצי ה־AWQ בגודל 22.8 גיגה בייט תצטרכו כרטיס מסך בודד עם 24 גיגה בייט זיכרון דוגמת RTX 3090 או RTX 4090, או סביבת שרת מקבילה. המודל נתמך בספריות דוגמת vLLM, SGLang, KTransformers ו־Transformers הרגילה.

אם אתם צריכים לנצל את כל חלון ההקשר שמגיע ל־262,144 טוקנים, כרטיס בודד לא יספיק בגלל גודל טבלת ה־KV, ותצטרכו חומרה חזקה בהרבה. במצב כזה, או אם אין לכם שרת ייעודי שרץ באופן רציף, פנייה לשירות ענן מנוהל כמו ה־API הרשמי תהיה זולה ופשוטה יותר.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="cyankiwi/Qwen3.5-35B-A3B-AWQ-4bit")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗