GPT
Q

Qwen3-VL-4B-Instruct

קוד פתוח

Qwenapache-2.02025-10-11

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל ראייה ושפה קומפקטי שמביא חלון הקשר ענק של 256K ויכולות סוכן לממשקי משתמש. הוא נותן מענה חזק למי שרוצה לעבד סרטונים ארוכים ומסמכים מקומית בלי לפשוט רגל על חומרה.

  • 4.4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 8.3 GBמשקל הקבצים
  • 4,105,723הורדות בחודש

מה זה

מדובר במודל משולב תמונה וטקסט עם 4.4 מיליארד פרמטרים שרץ על ארכיטקטורת Qwen3VL ייעודית. מעבר ליכולות הרגילות של תיאור תמונה, הוא נבנה מראש לשמש כסוכן ויזואלי שמסוגל לזהות אלמנטים גרפיים במסכים של מחשב ונייד, להבין את התפקיד שלהם ולהפעיל כלים בהתאם. הוא יודע גם להמיר תרשימים וסקיצות לקוד ישירות, כולל תמיכה בפורמטים כמו Draw.io, HTML ו־JS.

החידוש המרכזי כאן מול מודלים קטנים אחרים הוא הטיפול בווידאו ובהקשר ארוך. בעזרת מנגנון מיקום שמתפרס על פני זמן, רוחב וגובה, הוא מסוגל לאנדקס אירועים בווידאו לפי חותמות זמן ברמת השנייה. בנוסף, מנוע ה־OCR שלו שודרג לתמיכה ב־32 שפות ומסוגל להתמודד עם צילומים מטושטשים, תאורה חלשה, זיווד טקסט נטוי ופענוח מבנה של מסמכים מורכבים.

מתאים ל

  • אוטומציה של ממשקי משתמש

    זיהוי כפתורים ושדות במסכי מחשב או מובייל והפעלת כלים ישירות מתוך התמונה.

  • תחקור ואינדוקס וידאו

    עיבוד קבצי וידאו ארוכים ואיתור רגעים מדויקים לפי חותמת זמן ושאלות תוכן.

  • המרת עיצובים לקוד

    קריאת צילומי מסך או תרשימי זרימה ויצירת קוד HTML, Draw.io ו־JS מוכן לפיתוח.

איפה זה נופל

למרות השדרוג בראייה, מודל של 4.4 מיליארד פרמטרים עדיין מוגבל בהסקה לוגית עמוקה ועלול לפספס פרטים קטנים או להמציא עובדות בניתוח תמונות עמוסות מדי. התמיכה ב־OCR מורחבת אמנם ל־32 שפות, אך רשימת השפות המדויקת לא מפורטת ולכן חובה לבדוק אישית את הדיוק שלו על טקסטים בעברית, בייחוד בגופנים חריגים או כתב יד. נוסף לכך, הפעלת ממשקים ומשימות סוכן אוטונומיות מחייבות בדיקות בטיחות קפדניות לפני חיבור ישיר למערכות אמיתיות.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל ירוץ בצורה חלקה על מחשב נייד מקומי?

המשקל שלו הוא 8.3 גיגה בייט, כך שהוא דורש מעבד גרפי ייעודי עם לפחות 12 גיגה זיכרון וידאו להסקה בסיסית. במחשבים ללא חומרה גרפית מתאימה הביצועים יהיו איטיים מאוד.

האם המודל תומך בזיהוי טקסט ותמונות בעברית?

הכרטיס מציין הרחבה של ה־OCR ל־32 שפות אך אינו מונה אותן בשמן. אם המערכת מיועדת לעברית, יש לבצע בדיקת היתכנות על דוגמאות מקומיות לפני שילובו במוצר.

איך מריצים

המשקלים תופסים 8.3 גיגה בייט, מה שאומר שכרטיס מסך בודד עם 12 או 16 גיגה זיכרון יריץ אותו בקלות בהסקה מלאה. הוא נתמך ישירות בספריית transformers, אם כי לפי ההנחיות צריך להתקין את גרסת הפיתוח העדכנית ישירות מגיטהאב כי התמיכה בארכיטקטורה הזו חדשה לחלוטין.

אם אתם מתכננים להזין לו סרטונים ארוכים של שעות או לנצל את מלוא חלון ההקשר שמגיע ל־256 אלף טוקנים, תצטרכו הרבה יותר זיכרון וידאו בשביל ה־KV Cache. במקרים של עומסי קצה כאלה או אם אין לכם כרטיס מתאים, עדיף להשתמש בשרת ייעודי או לפנות לממשק מרוחק במקום להחזיק תשתית כבדה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-4B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצרים סגורים ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים ועותק של הרישיון המקורי בקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗