GPT
Q

Qwen3.5-9B-AWQ-4bit

קוד פתוח

cyankiwiapache-2.02026-03-02

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • conversational

גרסה מכווצת בארבעה ביטים של מודל מולטימודלי בגודל עשרה מיליארד פרמטרים. הוא נכנס לכרטיס מסך בודד של צרכנים ומציע חלון הקשר עצום של 262 אלף טוקנים.

  • 9.9Bפרמטרים
  • 262,144טוקנים בהקשר
  • 8.5 GBמשקל הקבצים
  • 152,565הורדות בחודש

מה זה

המשקלים האלה מייצגים מודל שמשלב ראייה וטקסט כבר משלבי האימון המוקדמים, ולא שכבת חיבור מאוחרת שנבנתה מעל מודל קיים. הארכיטקטורה משלבת שכבות של רשתות דלתא עם קשב רגיל כדי לשמור על מהירות גבוהה בחלונות ארוכים. התוצאה היא מודל שיודע לעבד תמונות, מסמכים והוראות מורכבות במקביל.

במבחני ביצועים הוא עוקף מודלים פתוחים גדולים בהרבה. במבחן הקוד LiveCodeBench v6 הוא מקבל 65.6, ובמבחן ההוראות המורכבות IFEval הוא מגיע ל־91.5, תוצאה גבוהה יותר מגרסאות שונות של מודלים במשקל 120 מיליארד פרמטרים. מנגד, במשימות תכנון מעמיקות כמו DeepPlanning הוא משיג רק 18 נקודות, כך שלא מדובר במנוע אוטונומי חף מטעויות.

מתאים ל

  • ניתוח מסמכים גרפיים

    השילוב המובנה בין תמונה לטקסט מאפשר לחלץ מידע מדויק מתרשימים וסריקות בלי להזדקק למנוע OCR נפרד.

  • סוכן תמיכה מקומי

    צריכת הזיכרון הנמוכה מאפשרת להריץ מוקד שיחה שמבין הוראות מורכבות על חומרה מקומית צנועה בעסק.

  • תחקור טקסטים ארוכים

    חלון הזיכרון הגדול מתאים לעיבוד מאמרים ארוכים או חוזים בבת אחת, כל עוד מקצים לכך מספיק זיכרון גרפי.

איפה זה נופל

למרות השילוב המוצלח בין תמונה וטקסט, המודל מתקשה בחשיבה לוגית עמוקה לאורך זמן. ציון של 29.2 בלבד במבחן האלגוריתמיקה OJBench מראה שהוא יתקשה מאוד במשימות תכנות תחרותי או פתרון באגים סבוכים.

נקודה נוספת היא תכנון סוכנים ארוך טווח. המודל מתבלבל בקלות בתרחישי עבודה מרובי צעדים, ולכן לא הייתי בונה עליו כסוכן עצמאי שמבצע פעולות קריטיות במערכת בלי בדיקת אנוש צמודה.

אותה משפחה

Qwen3.5 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הכימות ל־4 ביט פוגע ביכולת הראייה שלו?

הכימות נעשה בשיטת AWQ ששומרת על משקלי מפתח חשובים, כך שהירידה בדיוק מינימלית עבור רוב משימות זיהוי התמונה. עם זאת, תרשימים ברזולוציה גבולית או פרטים זעירים מאוד עלולים להתפספס בהשוואה למודל המקורי במשקל מלא.

האם המודל ירוץ בצורה חלקה על מחשב נייד רגיל?

לא על מעבד רגיל. המודל דורש כרטיס מסך ייעודי של Nvidia עם תמיכה בהרחבות AWQ וזיכרון VRAM פנוי של 12 גיגה בייט לפחות כדי לקבל קצב יצירת טוקנים שמיש בפועל.

איך מריצים

הקבצים שוקלים 8.5 גיגה בייט ומותאמים לכימות AWQ של ארבעה ביטים. כדי להריץ אותם מקומית עם מעטפת vLLM או Transformers תצטרכו כרטיס מסך בודד עם לפחות 12 עד 16 גיגה בייט זיכרון עבור שיחות קצרות.

אם אתם מתכוונים לנצל את מלוא חלון ההקשר, שמגיע ל־262,144 טוקנים, טבלת ה־KV תדרוש עשרות גיגה בייטים נוספים של זיכרון גרפי. במקרים כאלה של עומס קיצוני, החזקת שרת ייעודי עצמאי הופכת ליקרה מאוד, ועדיף להשתמש בנקודת קצה מנוהלת דרך ענן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="cyankiwi/Qwen3.5-9B-AWQ-4bit")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 מלא. הרישיון מאפשר שימוש מסחרי, שינוי של קוד המקור והפצה מחדש במוצרים סגורים בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗