GPT
Q

Qwen3.5-9B

קוד פתוח

Qwenapache-2.02026-02-27

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל מולטימודלי של 9.7 מיליארד פרמטרים שמשלב עיבוד תמונה וטקסט עם חלון הקשר עצום. הוא מתאים למי שרוצה ביצועים חזקים של סוכן אוטומטי בלי לתחזק שרת ענק.

  • 9.7Bפרמטרים
  • 262,144טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 11,389,211הורדות בחודש

מה זה

מדובר במודל שפה עם רכיב חזותי מובנה שמבוסס על ארכיטקטורה היברידית של שכבות Gated DeltaNet לצד מנגנוני Attention. השילוב הזה נועד לייצר קצב יצירת טוקנים גבוה וזמני תגובה קצרים יחסית לגודלו. בניגוד לחיבורים מאולצים של מודל תמונה למודל טקסט, כאן בוצע אימון מוקדם מאוחד על טוקנים משולבים, מה שמשפר את ההבנה המשולבת של תרשימים, ממשקים ומסמכים ארוכים.

במבחני הביצועים הוא מציג תוצאות מעניינות. במשימות תכנות כמו LiveCodeBench v6 הוא מגיע לציון של 65.6, שזה פער מורגש לעומת מודלים עצומים של 120 מיליארד פרמטרים. במשימות סוכנים כמו TAU2-Bench הוא משיג 79.1 ועוקף דגמים כבדים בהרבה. חלון ההקשר הטבעי עומד על 262,144 טוקנים ויכול להימתח עד מעבר למיליון טוקנים, מה שמאפשר להזין תיעוד טכני נרחב לצד צילומי מסך בלי לחתוך מידע.

מתאים ל

  • ניתוח מסמכים גרפיים

    השילוב המובנה בין תמונה לטקסט מאפשר לחלץ נתונים מדוחות סרוקים, תרשימים וקבלות ישירות לפורמט מובנה.

  • אוטומציה וקריאת ממשקים

    ציונים גבוהים בבנצ'מרקים של סוכנים מאפשרים לו לפעול על ממשקי משתמש מתוך צילומי מסך.

  • תחקור קוד ותיעוד ארוך

    חלון הקשר של 262 אלף טוקנים מאפשר להזין ספריות שלמות ומפרטים טכניים כדי לאתר באגים.

איפה זה נופל

למרות השאיפה לשמש כסוכן עצמאי, במבחני תכנון עמוק כמו DeepPlanning המודל מגיע לתוצאה של 18.0 בלבד. זה אומר שהוא עדיין מתבלבל ברצפים ארוכים של משימות מורכבות ודורש פיקוח הדוק. בנוסף, במבחני תכנות קשים מאוד כמו OJBench הוא עומד על 29.2, כך שלא כדאי לבנות עליו שיפתור בעיות אלגוריתמיות מסובכות ללא התערבות. גם התמיכה המוצהרת ב־201 שפות דורשת בדיקה זהירה בכל הנוגע לאיכות העברית לפני שמטמיעים אותו במערכת מול לקוחות.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל יכול לרוץ על כרטיס מסך ביתי?

כן, כרטיס עם 24 גיגה בייט זיכרון יספיק לטעינת המשקלים ששוקלים 18 גיגה בייט. עם זאת, אם תנצלו את מלוא חלון ההקשר, הזיכרון לא יספיק ותצטרכו לצמצם הקשר או להשתמש בפתרונות קוונטיזציה.

האם כדאי להסתמך עליו לפיתוח תוכנה אוטונומי לחלוטין?

לא. התוצאות שלו במבחני קוד מורכבים כמו OJBench נמוכות, כך שהוא יעיל בעיקר כעוזר פיתוח, להשלמת מקטעים או להסבר שגיאות, ולא לכתיבת מערכות שלמות מאפס.

איך מריצים

המשקל הכולל של הקבצים הוא 18.0 גיגה בייט. כדי להריץ אותו כמו שהוא בלי קוונטיזציה תצטרכו כרטיס מסך עם לפחות 24 גיגה בייט זיכרון, כמו RTX 3090 או 4090, וגם אז ניצול מלא של חלון ההקשר ידרוש זיכרון נוסף עבור ה־KV cache. הוא נתמך ישירות בספריות כמו transformers, vLLM, SGLang ו־KTransformers.

אם אתם מתכננים להריץ פניות ארוכות של מאות אלפי טוקנים או תעבורה גבוהה במקביל, כרטיס בודד יתקשה לעמוד בעומס. במצב כזה זול והגיוני יותר להשתמש ב־API חיצוני של ספק ענן במקום להחזיק שרת ייעודי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-9B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗