GPT
Q

Qwen3.5-35B-A3B-GPTQ-Int4

קוד פתוח

Qwenapache-2.02026-03-03

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת 4 ביט מכווצת של מודל מולטימודלי שמפעיל רק שלושה מיליארד פרמטרים מתוך 35 בפועל. אתם מקבלים שילוב של טקסט ותמונה בחלון הקשר עצום, בלי לדרוש שרת מרובה כרטיסים.

  • 36Bפרמטרים
  • 262,144טוקנים בהקשר
  • 22.8 GBמשקל הקבצים
  • 555,898הורדות בחודש

מה זה

מדובר במודל שמשלב קלט של טקסט ותמונה יחד, ונשען על ארכיטקטורת תערובת מומחים (MoE) היברידית. מתוך 35 מיליארד פרמטרים שיושבים בזיכרון, רק שלושה מיליארד מופעלים בכל צעד חישוב. המבנה הזה נותן מהירות תגובה גבוהה ותפוקת טוקנים מהירה יחסית למודלים דחוסים אחרים, כשהוא דורש 22.8 גיגה בייט בלבד של קבצים בפורמט GPTQ.

במדדי ההערכה הוא מתחרה היטב מול מודלים עצומים של מעל מאה מיליארד פרמטרים. במבחן TAU2-Bench למשל הוא מגיע לציון של 81.2 ועוקף אפילו את הגרסאות הגדולות של המשפחה. במשימות קידוד מורכבות כמו SWE-bench Verified הוא עומד על 69.2, שזה נתון יציב שמשאיר אותו צמוד למודלי בסיס כבדים בהרבה.

מתאים ל

  • בוט תמיכה טכנית מבוסס מסכים

    הוא מפעיל 3 מיליארד פרמטרים בלבד בכל צעד, ומסוגל לקרוא צילומי מסך וטקסט מהר על גבי כרטיס בודד.

  • סוכן בדיקות לקוד ואוטומציה

    תוצאה של 81.2 במבחן TAU2-Bench וציון גבוה בספריות קוד מתאימים להרצת פקודות ואינטראקציה מול ממשקים.

  • ניתוח מסמכים רב לשוני

    הוא אומן על 201 שפות ודיאלקטים ומחזיק חלון טוקנים עצום שמאפשר לעבד טקסטים מקומיים ארוכים.

איפה זה נופל

הקוונטיזציה ל־4 ביט גובה מחיר מסוים, ומבחני הביצועים מראים נפילה מורגשת ביחס לגרסאות הלא מכווצות במשימות ספציפיות. במבחן VITA-Bench לסוכנים הוא נעצר על 31.9 לעומת 41.9 בגרסת ה־27B הרגילה. בנוסף, בבדיקת ההקשר הארוך AA-LCR הוא קיבל 58.5, שזה ציון נמוך משמעותית מגרסאות אחרות בסדרה. אם המערכת שלכם נשענת על שליפת עובדות מדויקת מקבצים כבדים או תכנון מסלולים רב שלבי, כדאי לבדוק אותו ישירות מול החומרים שלכם לפני שמתחייבים אליו.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם כרטיס RTX 3090 אחד מספיק כדי להריץ אותו?

כן, המשקל יושב בתוך 22.8 גיגה בייט ונכנס לזיכרון של הכרטיס. החיסרון הוא שברגע שתשלחו פרומפטים עם עשרות אלפי טוקנים, זיכרון ה־KV ימלא את המקום הפנוי ותקבלו שגיאת זיכרון. לשיחות קצרות זה עובד חלק.

איך המודל מגיב כל כך מהר אם הוא בגודל 35 מיליארד פרמטרים?

הוא משתמש בארכיטקטורת תערובת מומחים. בכל רגע נתון רצים רק 8 מומחים נבחרים ועוד מומחה אחד משותף, כך שבפועל המעבד הגרפי מחשב רק 3 מיליארד פרמטרים פר טוקן.

איך מריצים

המשקל הכולל של הקבצים הוא 22.8 גיגה בייט, כך שאפשר לטעון אותו על כרטיס מסך בודד של 24 גיגה בייט כמו RTX 3090 או RTX 4090, אבל רק אם אתם לא מעמיסים על ההקשר. חלון ההקשר מגיע במקור עד 262,144 טוקנים, ואם תנצלו אפילו חלק ממנו, זיכרון ה־KV יגרום לקריסת זיכרון מידית בכרטיס בודד. בשביל הקשרים ארוכים באמת תצטרכו כרטיס מקצועי של 48 גיגה בייט או זוג כרטיסים ביתיים.

הוא נתמך ישירות בספריות כמו vLLM, SGLang ו־Transformers. אם אתם צריכים את מלוא החלון שמגיע בענן עד מיליון טוקנים, או שאין לכם כוח לנהל תשתית יקרה בשביל כמה קריאות ביום, הגרסה המנוהלת שנקראת Qwen3.5-Flash תהיה זולה ופשוטה יותר להרמה דרך API.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-35B-A3B-GPTQ-Int4")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותם מחדש ולשלב אותם בתוך מוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וכתב הוויתור המקורי של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗