GPT
Q

Qwen3.5-27B-AWQ

קוד פתוח

QuantTrioapache-2.02026-02-26

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • vLLM

גרסה מכווצת בשיטת AWQ של Qwen3.5 עם 28 מיליארד פרמטרים. היא מיועדת למי שרוצה להריץ מודל מולטימודלי כבד למשימות תכנות וסוכנים על שרת עם שני כרטיסי מסך בלי לשלם על API חיצוני.

  • 28Bפרמטרים
  • 262,144טוקנים בהקשר
  • 20.4 GBמשקל הקבצים
  • 388,530הורדות בחודש

מה זה

המודל הזה משלב ראייה ממוחשבת וטקסט כבר משלב האימון, ומגיע בארכיטקטורה היברידית של Gated DeltaNet עם מנגנון קשב רגיל. זה אומר שהוא מיועד לעבד קלטים ארוכים ביעילות גבוהה יותר בהשוואה לארכיטקטורות שנשענות רק על טרנספורמר קלאסי. הגרסה הספציפית כאן עברה קוונטיזציה ללא צורך במאגר כיול, מה שמאפשר להוריד את המשקל לזיכרון בלי לפגוע משמעותית בדיוק המקורי.

במדדי השפה והקוד של המודל המקורי, הוא מתחרה ראש בראש במודלים עצומים ממנו בהרבה. במבחן SWE-bench Verified הוא מגיע לציון 72.4, תוצאה שמקבילה למודלים קנייניים כמו GPT-5-mini, ובמבחן ההוראות IFEval הוא משיג 95.0. החיסרון הוא שתוצאות אלו שייכות למשקלים המקוריים, והכרטיס לא מציג מדידות שבוצעו ישירות על גרסת ה־AWQ הזו כדי לוודא שאין ירידה ביכולת.

מתאים ל

  • פיתוח סוכני תוכנה מקומיים

    שילוב יכולת קריאה לכלים לפי תקן ייעודי עם תוצאה של 72.4 ב־SWE-bench, מתאים לתיקון באגים אוטומטי במאגרי קוד פנימיים.

  • ניתוח מסמכים עם תמונות

    ארכיטקטורת אימון מולטימודלית מאוחדת מאפשרת לשלוח צילומי מסך וטקסט יחד ולקבל תשובות מנומקות הישר לתוך ה־vLLM.

  • מענה טכני מבוסס הקשר ארוך

    חלון בסיס של 262 אלף טוקנים יחד עם ארכיטקטורת DeltaNet מאפשר עיבוד לוגים ארוכים במיוחד על שרת פרטי.

איפה זה נופל

הבעיה הבולטת ביותר היא תכנות תחרותי ואלגוריתמיקה כבדה. במדד CodeForces המודל מוציא דירוג של 1899, נמוך משמעותית ממודלים אחרים באותה משפחה שעוברים את ה־2000, וגם מ־GPT-5-mini. בנוסף, משימות מסוף מורכבות ב־Terminal Bench 2 נעצרות על 41.6 אחוז הצלחה בלבד. תלות בספריות קוד שנמצאות בגרסאות dev מציבה גם סיכון יציבות ממשי לסביבות ייצור.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס GPU בודד של 24GB?

לא מומלץ לנסות. קובצי המודל עצמם תופסים 20.4 ג'יגה־בייט, כך שלא יישאר כמעט זיכרון לחלון הקשר וחישובים, ופקודת ההרצה הרשמית של המפרסם מגדירה tensor-parallel-size של 2 מראש.

האם יש צורך בקובץ נתונים מיוחד כדי לכייל את המודל?

לא. המפרסם מציין שהקוונטיזציה בוצעה במתודולוגיית data-free, ולכן המשקלים הותאמו מראש לפורמט AWQ ומוכנים לטעינה ישירה ללא שלב כיול נוסף.

איך מריצים

בפועל תצטרכו שרת עם לפחות שני מאיצי GPU מודרניים, כיוון שפקודת ההרצה של vLLM דורשת tensor parallel של 2 כדי להחזיק את 20.4 הג'יגה־בייט של המשקלים לצד זיכרון הקשר פעיל. בנוסף, הסביבה מחייבת גרסאות פיתוח ספציפיות מאוד: vllm מגרסה 0.16.0rc2 ומעלה, transformers בגרסת פיתוח 5.3, וסביבת cuda 12.8.

אם אתם צריכים רק שאילתות בודדות של זיהוי תמונה או מענה קצר מדי פעם, התחזוקה של שרת כזה תעלה לכם יותר מדי. עדיף לקרוא ל־API חיצוני. ההרצה העצמית הזו משתלמת רק אם אתם מעבדים נפח גבוה של מידע רגיש שלא יכול לצאת מהתשתית המקומית, או בונים סוכנים שרצים בלולאות רציפות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="QuantTrio/Qwen3.5-27B-AWQ")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה מחדש במוצרים סגורים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים ועותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗