GPT
Q

Qwen3.5-27B-AWQ-BF16-INT4

קוד פתוח

cyankiwiapache-2.02026-02-24

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • conversational

גרסה מכווצת של מודל מולטימודלי עם 28 מיליארד פרמטרים. הוא מיועד למי שרוצה יכולות עיבוד תמונה וטקסט מתקדמות בלי להחזיק שרת כפול.

  • 28Bפרמטרים
  • 262,144טוקנים בהקשר
  • 26.1 GBמשקל הקבצים
  • 5,110הורדות בחודש

מה זה

מדובר במודל שמשלב ראייה ממוחשבת ושפה בארכיטקטורה היברידית, שעברה כיול לדיוק של 4 ביט בשיטת AWQ. המודל בנוי על שילוב של שכבות Gated DeltaNet ורשתות קשב רגילות, מה שמאפשר לו להריץ משימות ארוכות ביעילות חישובית גבוהה. הוא מסוגל לקבל תמונות וטקסט יחד ומציע חלון הקשר בסיסי של 262,144 טוקנים.

במדדי ההערכה של שפה וקוד הוא עומד ראש בראש מול מודלים ענקיים. בבדיקת SWE-bench Verified הוא מגיע לתוצאה של 72.4, ובמבחן מעקב ההוראות IFEval הוא רושם 95.0, נתון שעוקף גם את GPT-5-mini מהטבלה. עם זאת, התוצאות האלה נמדדו על מודל הבסיס הלא מכווץ, ודחיסה ל־4 ביט תמיד גוררת פשרה מסוימת באיכות התוצרים.

מתאים ל

  • סוכני פעולה וממשקי טרמינל

    הוא מגיע ל־41.6 במדד Terminal Bench 2, ציון חזק ביחס לגודל שמתאים להרצת פקודות ואוטומציות.

  • מעקב אחר הוראות מורכבות

    עם ציון של 95.0 ב־IFEval, הוא מתאים לבניית ממשקים הדורשים דיוק מוחלט במבנה הפלט.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 262 אלף טוקנים מאפשר לבלוע קבצים כבדים ותמונות בלי לאבד את ההקשר.

איפה זה נופל

החולשה הבולטת ביותר בנתונים היא תכנות תחרותי ואלגוריתמיקה מורכבת. במבחן CodeForces המודל מקבל דירוג של 1899 בלבד, נמוך משמעותית משאר המודלים בסדרה שהגיעו מעל 2100. בנוסף, בביצוע משימות תכנון מורכבות במדד DeepPlanning הוא עוצר ב־22.6 אחוז הצלחה, מה שאומר שלא כדאי לסמוך עליו בעיצוב מערכות סבוכות ללא בקרה צמודה.

אותה משפחה

Qwen3.5 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל ירוץ על כרטיס RTX 4090 בודד?

לא. משקל הקבצים לבדו הוא 26.1 גיגה בייט, והוא חורג מ־24 הגיגה הקיימים בכרטיס. תצטרכו לחלק את הטעינה לשני כרטיסים או להריץ אותו על כרטיס עם 32 או 48 גיגה זיכרון.

האם יש ירידה באיכות בגלל הכיווץ ל־INT4?

כן, כיווץ AWQ שומר על רוב היכולות אבל כמעט תמיד חותך מעט מהדיוק בקצוות. במשימות חשיבה מורכבות או בעיות מתמטיקה עדינות תיתכן ירידה קלה לעומת משקלי הבסיס המלאים.

איך מריצים

המשקל הכולל של הקבצים עומד על 26.1 גיגה בייט. כדי לטעון אותו ולהשאיר מקום ל־KV cache תצטרכו כרטיס מסך בודד עם לפחות 32 גיגה זיכרון, או שני כרטיסים של 24 גיגה כמו RTX 3090 או 4090. המודל מותאם לעבודה ישירה בספריות כמו vLLM, SGLang ו־Transformers.

אם אין לכם חומרה ייעודית מקומית ואתם רק בודקים רעיון, עדיף להשתמש ב־API חיצוני. הרמה של שרת ענן עם חומרה מתאימה רק לצורך ניסוי תעלה לכם יותר זמן וכסף מחיבור פשוט לשירות מנוהל.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="cyankiwi/Qwen3.5-27B-AWQ-BF16-INT4")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של המשקלים והפצה של המערכת בתוך מוצרים סגורים. הדרישה היחידה היא לשמור על הצהרת זכויות היוצרים והודעת הרישיון המקורית בקבצים שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗