GPT
Q

Qwen3.6-27B-int4-AutoRound

קוד פתוח

Lorbusapache-2.02026-04-22

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • autoround

גרסת INT4 של מודל הראייה והשפה Qwen3.6-27B ששוקלת 17.7 גיגה במקום 54. היא שומרת על מנגנון הניבוי המובנה כדי להכפיל את מהירות היצירה בריצה מקומית.

  • 6.3Bפרמטרים
  • 262,144טוקנים בהקשר
  • 17.7 GBמשקל הקבצים
  • 780,472הורדות בחודש

מה זה

מדובר בדחיסה של מודל מולטימודלי בגודל 27 מיליארד פרמטרים שנעשתה באמצעות AutoRound של אינטל. המטרה העיקרית כאן היא לא סתם לחתוך את המשקל לשליש, אלא לפתור בעיה ספציפית שקיימת בקוונטיזציות רגילות של המשפחה הזו. המפתח החזיר שכבה ספציפית של מנגנון Multi-Token Prediction לדיוק BF16 מקורי, כדי שמנוע ההרצה vLLM יוכל להשתמש בו לחיזוי ספקולטיבי.

בבדיקות הביצועים עם כרטיס RTX 5090 ומטמון KV מכווץ, המודל הגיע למהירות של כשישים טוקנים לשנייה. בלי מנגנון החיזוי הזה המהירות צונחת לאזור 32 טוקנים לשנייה, כך שהשמירה על השכבה הזו מכפילה את קצב הפליטה בפועל. רכיבי הראייה של המודל, מודול MoonViT, נשארו בדיוק המקורי שלהם ולא עברו כיול ל־4 ביט.

מתאים ל

  • שרת הסקה לתמונות וטקסט

    ניתוח מסמכים ותמונות בחומרה מקומית של 32GB, תוך שמירה על קצב תגובה מהיר הודות למנגנון החיזוי המובנה.

  • ניתוח טקסטים ארוכים

    טעינת הקשרים של מעל 100 אלף טוקנים על גבי כרטיס בודד בלי לחרוג ממגבלות הזיכרון של שרתים עצמאיים.

  • הפעלת כלים ופונקציות

    קריאה לפונקציות ועיבוד תשובות במבנה XML ישירות מול ממשק תואם OpenAI עם תמיכה מובנית בחלוקת משימות.

איפה זה נופל

הכיול נעשה במתכון ברירת המחדל עם 128 דגימות בלבד, מה שאומר שדיוק המודל הוקרב לטובת חיסכון בזיכרון ומהירות. למי שמחפש פלט אמין במשימות חישוב קריטיות, הדחיסה הזו עלולה להציג ירידה באיכות ביחס למודל המלא. בנוסף, חלון ההקשר המלא של 262 אלף טוקנים לא נבדק לעומק מעבר ל־128 אלף, כך שהתנהגות המודל בקצוות הזיכרון שלו עדיין דורשת בדיקה זהירה.

שאלות
נפוצות

אפשר להריץ את המודל ישירות דרך ספריית Transformers?

כן, הקוד הסטנדרטי עובד עם remote code מופעל, אבל אז מאבדים את מנגנון הניבוי המהיר. במצב כזה קצב היצירה נחתך בחצי לעומת שימוש בשרת vLLM מותאם.

למה רכיב הראייה לא כווץ ל־4 ביט?

היוצר התמקד רק בחלק השפתי של המודל. משקלי התמונה של MoonViT נשארו בדיוק המקורי שלהם כדי למנוע עיוותים ואיבוד איכות בעיבוד קלטים חזותיים.

איך מריצים

בפועל צריך כרטיס מסך אחד עם 32GB של זיכרון כדי להריץ את השרת בנוחות יחד עם הקשר ארוך. כרגע ההרצה היעילה ביותר דורשת גרסת פיתוח מיוחדת של vLLM שתומכת במטמון 4 ביט ובמנגנון MTP, יחד עם פרמטרים שמבטלים שימוש ב־CUDA graphs על ארכיטקטורת בלקוול כדי למנוע קריסות מוכרות.

אם יש לכם כרטיס עם פחות מ־24GB זיכרון או שאין לכם גישה לגרסאות הליליות של מנועי ההסקה, ההתקנה הזו תהיה מלחמת תלויות מתישה. במצב כזה עדיף לשלם לפי טוקן ב־API מרוחק של המודל המקורי, במיוחד אם לא מנצלים את היכולת של המודל לעבד תמונות לצד טקסט.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Lorbus/Qwen3.6-27B-int4-AutoRound")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0, בדיוק כמו גרסת המקור של עליבאבא. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והעתק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗