GPT
Q

Qwen3.5-27B-GPTQ-Int4

קוד פתוח

Qwenapache-2.02026-03-03

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת בארבעה ביטים של מודל מולטימודלי עם עשרים ושמונה מיליארד פרמטרים. הוא מיועד למי שרוצה יכולות ראייה וקוד חזקות בלי לתחזק שרת כבד מדי.

  • 28Bפרמטרים
  • 262,144טוקנים בהקשר
  • 28.2 GBמשקל הקבצים
  • 61,527הורדות בחודש

מה זה

מדובר במודל שמשלב טקסט ותמונה ומכיל 27,781,427,952 פרמטרים, בארכיטקטורה היברידית שכוללת שכבות Gated DeltaNet ורשתות קשב. המטרה של המבנה הזה היא לתת מהירות הסקה גבוהה לצד צריכת זיכרון שפויה יחסית לגודל שלו. התמיכה בטקסט רחבה מאוד ומכסה 201 שפות ודיאלקטים, לצד חלון הקשר טבעי של 262,144 טוקנים שניתן להרחבה עד מעל מיליון.

במבחני ביצועים הוא עומד יפה מאוד מול מודלים גדולים ממנו בהרבה. במבחן SWE-bench Verified הוא מקבל 72.4, תוצאה שעוקפת אפילו את GPT-OSS-120B עם 62.0 ומשתווה לגרסת ה־122B של אותה סדרה. במבחני מעקב אחרי הוראות כמו IFEval הוא מגיע ל־95.0, מה שמראה שהוא מבין הנחיות מורכבות ולא מאבד כיוון. עם זאת, התוצאות בטבלה נמדדו על מודל הבסיס הלא מכווץ, ולכן בגרסת ה־Int4 הזו ייתכנו סטיות קלות בביצועים בפועל.

מתאים ל

  • סוכני ניתוח ממשק ומסמכים

    שילוב ראייה וטקסט עם ציון 79.0 ב־TAU2-Bench מתאים לניתוח צילומי מסך ודפי מידע מורכבים.

  • עוזר פיתוח מקומי

    עם ציון 72.4 ב־SWE-bench, הוא מספק בדיקות קוד ותיקון באגים בלי להוציא קוד פנימי החוצה.

  • מענה טכני רב לשוני

    כיסוי של 201 שפות וחלון של 262 אלף טוקנים מאפשרים סריקת תיעוד טכני שלם בשפות שונות.

איפה זה נופל

החולשה העיקרית שלו מופיעה במשימות תכנות תחרותי ובדיקות קצה. במבחן CodeForces הוא משיג ציון של 1899, שזה נמוך משמעותית מגרסת ה־35B של הסדרה שקיבלה 2028 ומ־GPT-5-mini שהגיע ל־2160. במבחן תכנון מורכב כמו DeepPlanning הוא עומד על 22.6 בלבד, וב־VITA-Bench על 41.9. בנוסף, מדובר בכיבוץ מסוג GPTQ Int4, תהליך שעלול לייצר ירידה בדיוק במשימות שמחייבות חישובים עדינים, ולכן חייבים לבדוק את התפוקה מול משימות הקוד הספציפיות שלכם לפני שסומכים עליו אוטומטית.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל ירוץ על כרטיס מסך בודד של 24 גיגה?

לא. הקבצים עצמם שוקלים 28.2 גיגה בייט, כך שהם לא ייכנסו במלואם לזיכרון של 24 גיגה. תצטרכו כרטיס עם 32 גיגה לפחות, או שני כרטיסי 16 או 24 גיגה במקביל.

מה המשמעות של ארכיטקטורת Gated DeltaNet שמוזכרת בכרטיס?

זהו מנגנון קשב ליניארי שנועד לאפשר עיבוד מהיר יותר של טקסט ארוך בלי צווארי הבקבוק הרגילים של מודלי שפה. המבנה הזה מקטין את זמן ההמתנה לתגובה ושומר על קצב יצירת טוקנים יציב גם בעומס.

האם יש תמיכה טבעית בעברית?

הכרטיס מדווח על כיסוי לשוני של 201 שפות ודיאלקטים. המשמעות היא שהמודל אומן על מגוון שפות רחב, אך יש לבחון אותו מקומית על הניואנסים והטרמינולוגיה שלכם כדי לוודא שאיכות התחביר עומדת בדרישות.

איך מריצים

המשקל הכולל של הקבצים עומד על 28.2 גיגה בייט, מה שאומר שצריך כרטיס מסך אחד עם לפחות 32 גיגה זיכרון כדי לטעון אותו, או לחלק אותו על פני שני כרטיסים קטנים יותר. אם יש לכם כרטיס בודד של 24 גיגה, המשקל של המודל יחד עם הזיכרון הנדרש להקשר פשוט יחנוק את החומרה.

ההרצה נתמכת בספריות transformers, vLLM, SGLang ו־KTransformers. אם אתם מתכוונים לפתוח את כל חלון ההקשר המלא של 262 אלף טוקנים, תצטרכו נפח זיכרון עצום עבור ה־KV cache, ובמצב כזה עדיף לקרוא למודל דרך שירות ענן חיצוני במקום להשקיע בחומרה מקומית יקרה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-27B-GPTQ-Int4")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, שזה רישיון קוד פתוח מתירני ונוח. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בלי לשלם תמלוגים ובלי חובה לחשוף את הפיתוחים שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הוויתור על אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗