GPT
Q

Qwen3.5-27B-AWQ-4bit

קוד פתוח

cyankiwiapache-2.02026-02-25

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • conversational

גרסה מכווצת בארבעה ביטים למודל מולטימודלי של עשרים ותשעה מיליארד פרמטרים. היא נכנסת לכרטיס מסך בודד ומציגה יכולות תכנות ומעקב פקודות של מודלים ענקיים.

  • 29Bפרמטרים
  • 262,144טוקנים בהקשר
  • 18.7 GBמשקל הקבצים
  • 178,431הורדות בחודש

מה זה

מדובר במודל שמשלב טקסט ותמונה תחת ארכיטקטורה היברידית של שכבות תשומת לב לצד רשתות דלתא. החבילה הזו עברה קוונטיזציה בשיטת AWQ לארבעה ביטים, מה שדוחס כמעט עשרים ותשעה מיליארד פרמטרים לנפח של פחות מתשעה עשר גיגה בייט. השילוב הזה מאפשר לו לרוץ מהר יותר ועם פחות משאבי זיכרון ביחס לגרסאות מלאות, תוך שמירה על רוב הדיוק המקורי במשימות מורכבות.

במבחני הביצועים הוא עומד ראש בראש מול מודלים עצומים ממנו בהרבה. במבחן SWE-bench Verified שבודק פתרון תקלות קוד אמיתיות הוא משיג 72.4 אחוז, שזה מעט מעל GPT-5-mini. במבחני מעקב אחרי הוראות מדויקות כמו IFEval הוא מגיע לציון 95, ובמבחן סוכנים מורכב כמו VITA-Bench הוא רושם 41.9 אחוז ומשאיר מאחור מודלים בגודל של מעל מאה מיליארד פרמטרים. המשמעות בשטח היא יכולת לטפל בלוגיקה קשה בלי להחזיק אשכול שרתים יקר.

מתאים ל

  • סוכן בדיקות ותיקון קוד

    תוצאה של 72.4 אחוז במבחן SWE-bench הופכת אותו למתאים במיוחד לאיתור באגים אוטומטי במאגרי קוד.

  • מיצוי מידע ממסמכים וגרפים

    השילוב המובנה בין קריאת תמונה לפענוח טקסט מאפשר לנתח תרשימים ודוחות בלי להפעיל מודל ראייה נפרד.

  • אוטומציה של פקודות מערכת

    ציון של 41.6 אחוז בבנצ'מרק של מסופי פקודה נותן לו עדיפות בהפעלת כלים וסקריפטים מורכבים בסביבת פיתוח.

איפה זה נופל

המודל מציג חולשה יחסית בתחרויות תכנות תחת לחץ זמנים, עם דירוג 1899 בלבד ב־CodeForces, בעוד מודלים אחרים באותה השוואה עוברים את קו האלפיים. בנוסף, קוונטיזציה לארבעה ביטים תמיד גובה מחיר קטן בדיוק המספרי לעומת משקלי המקור. הכרטיס גם לא מפרט נתונים ספציפיים לגבי רמת השליטה בעברית או תמיכה בראיית מסמכים מורכבים בשפות מקומיות, ולכן חובה לבדוק אותו על הדאטה הספציפי שלכם לפני שסומכים עליו אוטומטית.

אותה משפחה

Qwen3.5 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא יעבוד על מחשב אישי רגיל בלי כרטיס ייעודי?

לא מומלץ לנסות. הקבצים שוקלים קרוב לתשעה עשר גיגה בייט ומחייבים כרטיס גרפי מתאים כדי לספק קצב סביר, ולא הרצה אטית על מעבד מרכזי.

כמה מתוך חלון ההקשר הענק באמת שמיש בכרטיס בודד?

החלון תומך תיאורטית ביותר ממאתיים ושישים אלף טוקנים, אבל כרטיס עם עשרים וארבעה גיגה יתמלא מהר מאוד. בפועל תצטרכו להסתפק בעשרות אלפי טוקנים או לחבר זיכרון נוסף.

איך מריצים

המשקל הכולל יושב על 18.7 גיגה בייט, כך שכרטיס מסך יחיד עם עשרים וארבעה גיגה בייט זיכרון יספיק כדי להעלות אותו. אפשר לטעון אותו בעזרת ספריות כמו vLLM, SGLang או ישירות דרך transformers עם תמיכה בפורמט AWQ. אם מתכננים לנצל את מלוא חלון ההקשר העצום שעומד על מעל מאתיים ושישים אלף טוקנים, תוספת הזיכרון עבור זיכרון ההקשר תדרוש כרטיס חזק בהרבה או חלוקה לכמה כרטיסים.

אם אין לכם כרטיס ייעודי זמין ברמה הזו וכל מה שאתם צריכים זה שאילתות בודדות של תמונה וקוד, עדיף להשתמש בנקודת קצה מנוהלת דרך ספק ענן. להחזיק שרת כזה פעיל רק בשביל הרצה פעם בשעה יעלה הרבה יותר מצריכת שירות לפי שימוש.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="cyankiwi/Qwen3.5-27B-AWQ-4bit")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המקורי. המשמעות היא חופש מלא לשימוש פנימי, מסחרי, שינוי קוד והפצה מחדש בתוך מוצרים, כל עוד אתם שומרים על הודעת הרישיון וזכויות היוצרים המקוריות של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗