GPT
Q

Qwen3-VL-235B-A22B-Instruct

קוד פתוח

Qwenapache-2.02025-09-22

  • transformers
  • safetensors
  • qwen3_vl_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מפלצת ראייה וטקסט עם ארכיטקטורת תערובת מומחים, שמפעילה רק חלק קטן מהמשקל שלה בכל טוקן. היא מיועדת למי שצריך לפענח שעות של וידאו או ממשקי מחשב בלי לשלוח מידע רגיש לשירותי ענן סגורים.

  • 236Bפרמטרים
  • 262,144טוקנים בהקשר
  • 439 GBמשקל הקבצים
  • 528,410הורדות בחודש

מה זה

מדובר במודל רב מודלי ענק שמקבל תמונות, וידאו וטקסט ומוציא טקסט, אבל בנוי כארכיטקטורת תערובת מומחים. מתוך 236 מיליארד פרמטרים בסך הכול, רק 22 מיליארד מופעלים בכל רגע נתון. המבנה הזה נותן מהירות תגובה של מודל בינוני לצד קיבולת ידע של מודל ענק. הוא יודע לנתח מסמכים סרוקים, לתפעל ממשקי משתמש במחשב ובטלפון, ולתרגם צילומי מסך ישירות לקוד כמו דפי אינטרנט או תרשימים.

השדרוג המרכזי כאן נוגע לעבודה עם ציר הזמן והמרחב. הוא מבין סרטונים ארוכים ומסוגל לקשר אירועים לנקודות זמן מדויקות בשניות, לצד יכולת לזהות מיקום מרחבי של עצמים בתלת ממד. זיהוי הטקסט בתמונות הורחב ל־32 שפות ועובד גם על צילומים מטושטשים או מסמכים עקומים. חלון ההקשר המובנה עומד על 262,144 טוקנים, מה שמאפשר להזין לו ספרים שלמים או הקלטות ארוכות בלי לחתוך אותם מראש.

מתאים ל

  • ניתוח הקלטות וידאו ארוכות

    איתור אירועים בתוך שעות של וידאו ברמת דיוק של שניות בזכות חלון הקשר עצום ומיפוי זמנים מדויק.

  • המרת עיצובים לקוד

    תרגום ישיר של תמונות מסך ותרשימים לקוד HTML, CSS, JavaScript ותרשימי Draw.io.

  • הפעלת סוכן לממשקי משתמש

    זיהוי אלמנטים גרפיים על מסך מחשב או נייד והפעלת פעולות במערכת ההפעלה באופן עצמאי.

איפה זה נופל

הכרטיס מציג שיפורים מרשימים אבל מסתיר את המספרים המדויקים, שכן טבלאות הביצועים מופיעות כתמונות חיצוניות ללא נתונים מספריים גלויים בטקסט. המפתחים גם לא מציינים באילו 32 שפות הראייה נתמכת, כך שאין שום הבטחה לגבי איכות הפענוח של עברית במסמכים סרוקים או בצילומי מסך. לפני שמבססים עליו מוצר, חובה לבדוק בעצמכם איך הוא מתמודד בפועל עם טקסט מקומי, זיהוי כיווניות והבנת רכיבי ממשק מורכבים.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב פיתוח עם כרטיס מסך אחד חזק?

לא. למרות שבכל טוקן רצים רק 22 מיליארד פרמטרים, כל 236 מיליארד הפרמטרים שוקלים יחד 439 גיגה בייט וחייבים להיטען במלואם לזיכרון ה־VRAM. תצטרכו שרת ייעודי מרובה כרטיסים בעלי נפח זיכרון גבוה מאוד רק כדי להעלות אותו לאוויר.

האם המודל מתאים לחילוץ נתונים מטפסים ומסמכים בעברית?

היצרן מצהיר על תמיכה ב־32 שפות וביכולת להתמודד עם מסמכים מטושטשים, אך אינו מפרט אילו שפות נכללות ברשימה. מומלץ להריץ בדיקה ידנית על קובץ סרוק בעברית לפני שמחליטים להשתמש בו למשימות פענוח מקומיות.

איך מריצים

כדי להריץ אותו מקומית תצטרכו שרת עם כמה מעבדים גרפיים חזקים במיוחד. המשקל הכולל של הקבצים עומד על 439 גיגה בייט, כך שגם אם מפעילים רק 22 מיליארד פרמטרים בחישוב, כל המשקלים חייבים לשבת בזיכרון של כרטיסי המסך בו זמנית. שרת ביתי או כרטיס בודד בכלל לא באים בחשבון.

הקוד דורש התקנה ישירה של ספריית transformers מהמאגר הרשמי בגיטהאב, כי הגרסה הרשמית שתומכת בו עדיין לא יצאה בזמן פרסום המודל. אם אין לכם אשכול שרתים ייעודי שפועל מסביב לשעון, החזקה עצמית של מפלצת כזו תעלה הון, וברוב המקרים עדיף לפנות לנקודת קצה מנוהלת דרך ספק צד שלישי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-235B-A22B-Instruct")
print(pipe("שלום"))

הקבצים

108 קבצים במאגר, 439 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להטמיע אותו בתוך מוצרים סגורים ולהפיץ אותו הלאה, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗