GPT
Q

Qwen3-VL-235B-A22B-Thinking

קוד פתוח

Qwenapache-2.02025-09-22

  • transformers
  • safetensors
  • qwen3_vl_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל ראייה ושפה ענק בתצורת תערובת מומחים עם מנגנון חשיבה מובנה. הוא מיועד לניתוח סרטונים ארוכים, קריאת מסמכים סבוכים ופתרון בעיות שדורשות פירוק שלבי מעמיק.

  • 236Bפרמטרים
  • 262,144טוקנים בהקשר
  • 439 GBמשקל הקבצים
  • 9,537הורדות בחודש

מה זה

מדובר בגרסת חשיבה שמבוססת על ארכיטקטורת תערובת מומחים, עם מאתיים שלושים ושישה מיליארד פרמטרים בסך הכול אבל רק כעשרים ושניים מיליארד פעילים בכל צעד חישוב. השילוב הזה נותן כוח של מודל ענק עם מהירות תגובה של מודל קטן בהרבה. המערכת כוללת חלון הקשר של מאתיים חמישים ושישה אלף טוקנים בבסיס, עם יכולת הרחבה למיליון, מה שמאפשר להזין שעות של וידאו או ספרים שלמים בלי לאבד פרטים.

המודל מיועד להתמודד עם משימות ראייה חישובית מורכבות במיוחד. הוא משלב שכבות מידע חזותי לזיהוי פרטים זעירים, מזהה מיקומים ותלת ממד במרחב, ומסוגל לנווט בממשקי משתמש של מחשב וטלפון. מנוע הראייה שלו כולל תמיכה בקריאת טקסט בשלושים ושתיים שפות, כולל התמודדות עם טקסטים מטושטשים או צילומים בזוויות קשות, ובמקביל יודע להמיר סקיצות ותרשימים ישירות לקוד.

מתאים ל

  • ניתוח וידאו ארוך

    חלון ההקשר העצום מאפשר לסרוק הקלטות של שעות ולחלץ אירועים בדיוק של שנייה.

  • פענוח מסמכים מורכבים

    זיהוי תווים משודרג מאפשר לחלץ טבלאות ומבנים מצילומים באיכות ירודה או בזוויות עקומות.

  • המרת עיצובים לקוד

    תרגום תרשימים וסקיצות ויזואליות ישירות לדפי אינטרנט או קוד תצוגה.

איפה זה נופל

כרטיס המודל מציג תמונות של טבלאות ביצועים במקום לפרט את הנתונים והציונים בטקסט קריא, כך שקשה לדעת בדיוק איפה הוא עומד ביחס למתחרים בלי להסתמך על הצהרות כלליות. מנגנון החשיבה המובנה מאריך את זמן המענה ומייצר טוקנים נסתרים לפני התשובה הסופית, מה שמייקר כל קריאה ומאט את המערכת. בנוסף, למרות ההרחבה לתמיכה בשפות שונות, עברית לא מוזכרת במפורש במסמכים וסביר שתתפקד פחות טוב משפות מרכזיות.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת יחיד עם כרטיס גרפי אחד?

ממש לא. הקבצים שוקלים מעל ארבע מאות גיגה בייט, כך שגם עם קוונטיזציה תצטרכו שרת מרובה כרטיסים מקצועיים כדי להחזיק את המודל בזיכרון ולהריץ שאילתות.

במה שונה גרסת התערובת הזו ממודל רגיל באותו גודל?

היא מפעילה רק עשרים ושניים מיליארד פרמטרים מתוך מאתיים שלושים ושישה בכל שלב. זה מאפשר לקבל יכולות הסקה גבוהות של מודל ענק במהירות חישוב שמתקרבת למודלים בינוניים.

איך מריצים

כדי להריץ מפלצת כזו מקומית צריך מערך חומרה רציני מאוד. המשקלים לבדם תופסים ארבע מאות שלושים ותשעה גיגה בייט ומחולקים ליותר ממאה קבצים, מה שאומר שתצטרכו שרת עם כמה כרטיסי A100 או H100 של שמונים גיגה רק כדי לטעון אותם לזיכרון לפני שבכלל פתחתם חלון הקשר רחב. ההרצה דורשת התקנה של ספריית הטרנספורמרס ישירות מקוד המקור בגיטהאב כי התמיכה בארכיטקטורה הזו חדשה.

אם אין לכם קלאסטר ארגוני ייעודי שיושב ומחכה למשימות כאלה, אין שום היגיון כלכלי או תפעולי לנסות לארח אותו לבד. עדיף בהרבה להשתמש בנקודת קצה מנוהלת דרך ענן או שירות צד שלישי ולשלם לפי טוקן, במיוחד כשרוצים לבדוק התכנות לפני שמתחייבים לעלויות שרתים כבדות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-235B-A22B-Thinking")
print(pipe("שלום"))

הקבצים

108 קבצים במאגר, 439 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון כאן הוא אפאצ'י שתיים אפס מלא וחופשי. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לכוונן אותו על נתונים פרטיים ולשלב אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים ליוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים המקורית והצהרה על שינויים שבוצעו בקבצים, בלי לקחת אחריות משפטית על התוצאות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗