GPT
Q

Qwen3-VL-30B-A3B-Instruct

קוד פתוח

Qwenapache-2.02025-09-30

  • transformers
  • safetensors
  • qwen3_vl_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל ראייה ושפה שמבוסס על תצורת מומחים עם חלון הקשר עצום של 256K. הוא מיועד למי שצריך לפענח שעות של וידאו או ממשקי משתמש בלי לשלם על מודל ענק בכל שאילתה.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 57.9 GBמשקל הקבצים
  • 378,022הורדות בחודש

מה זה

מדובר במודל שמשלב טקסט ותמונה בארכיטקטורת תערובת מומחים עם 31 מיליארד פרמטרים בסך הכל. השילוב הזה מאפשר לו לעבד תמונות, מסמכים ארוכים ווידאו של שעות ברמת דיוק של שניות בודדות, לצד יכולות פענוח של רכיבי מסך במחשב ובנייד. המודל כולל שיפורים בעיגון מרחבי בדו־ממד ובתלת־ממד, ומסוגל לייצר קוד מתוך תרשימים או צילומי מסך.

בגזרת הטקסט והראייה, הוא כולל מנוע זיהוי תווים משודרג שתומך ב־32 שפות ומבטיח התמודדות טובה יותר עם טשטוש, זוויות צילום קשות ומסמכים סרוקים מורכבים. הארכיטקטורה שלו מפעילה רק חלק מהפרמטרים בכל שלב, מה שנותן מהירות תגובה טובה ביחס לנפח הידע הכולל שלו בלי לאבד עומק בהסקה לוגית או במתמטיקה.

מתאים ל

  • אוטומציה של ממשקי תוכנה

    זיהוי כפתורים ושדות במסכי מחשב וטלפון לצורך הפעלת סוכנים אוטומטיים שמבצעים פעולות במקום משתמש אנושי.

  • תחקור קובצי וידאו ארוכים

    חיפוש אירועים ממוקדים לפי חותמת זמן מתוך הקלטות אבטחה או הרצאות של שעות בלי לחתוך את הקובץ.

  • המרת עיצובים לקוד תצוגה

    תרגום ישיר של תצלומי מסך ותרשימים לקוד HTML, CSS או Draw.io שמוכן לפיתוח מהיר.

איפה זה נופל

הכרטיס מציג טבלאות ביצועים כתמונות בלבד ולא חושף את המספרים המדויקים, מה שמקשה לאמת את הטענות בלי בדיקה עצמאית. בנוסף, מודלים שמתיימרים לזהות הכל כולל דמויות ומוצרים נוטים להזיות כשמציגים להם תוכן מקומי פחות מוכר. זיהוי הטקסט תומך ב־32 שפות בלבד, וללא בדיקה מפורטת מול עברית קשה להסתמך עליו לפענוח מסמכים בארץ.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

כמה זיכרון וידאו צריך כדי להריץ את המודל הזה אצלי?

המשקלים לבדם תופסים קרוב ל־60 גיגה בייט. להרצה בסיסית תצטרכו לפחות 80 גיגה של VRAM, אבל אם תנצלו את כל חלון ההקשר של 256K טוקנים, תצטרכו שרת עם מספר כרטיסים כדי לא לקבל שגיאת זיכרון.

האם המודל מתאים לפענוח קבלות ומסמכים בעברית?

הכרטיס מציין תמיכה ב־32 שפות ללא פירוט הרשימה המלאה. מומלץ להריץ בדיקה על מדגם מסמכים אמיתי לפני שמשלבים אותו במוצר, כי מנועי OCR גלובליים מתקשים לעיתים קרובות עם כיווניות של שפות מימין לשמאל.

איך מריצים

כדי להריץ 58 גיגה בייט של משקלים ברמת דיוק מלאה, צריך שרת עם שני כרטיסי A100 או H100 של 80 גיגה, במיוחד אם רוצים לנצל את חלון ההקשר המלא שמגיע ל־262,144 טוקנים. אם תרצו להסתפק בכרטיס בודד, תהיו חייבים לכווץ את המודל לקוונטיזציה של 4 או 8 ביט.

הקוד דורש התקנה של ספריית transformers ישירות מהמאגר של גיטהאב כי הגרסאות הרשמיות הישנות לא מכירות את הארכיטקטורה. אם אין לכם תשתית ענן ייעודית שרצה כל הזמן, עדיף להשתמש ב־API מנוהל מאשר להחזיק שרת יקר שיעמוד חצי יום בלי עבודה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-30B-A3B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר סגור ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון השינויים שביצעתם בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗