GPT
Q

Qwen3-VL-2B-Instruct

קוד פתוח

Qwenapache-2.02025-10-19

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל ראייה ושפה קטן של שני מיליארד פרמטרים שמביא חלון הקשר עצום. מתאים למי שרוצה ניתוח מסמכים ווידאו מקומית בלי חומרה כבדה.

  • 2.1Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.0 GBמשקל הקבצים
  • 2,986,461הורדות בחודש

מה זה

מדובר במודל מולטימודלי קומפקטי שמכוון למשימות ראייה מורכבות יחד עם טקסט. למרות הגודל הצנוע שלו, הוא מגיע עם חלון הקשר מובנה של 262,144 טוקנים, מה שמאפשר לו לבלוע ספרים שלמים או סרטוני וידאו ארוכים ברמת אינדוקס של שניות. הוא מיועד לפעול כסוכן ויזואלי שיודע לנווט בממשקי משתמש של מחשב וטלפון, להבין פקדים ולתרגם עיצובים או תרשימים ישירות לקוד כמו HTML ו־CSS.

הארכיטקטורה שלו משלבת תכונות מכמה שכבות של רשת הראייה כדי לתפוס פרטים קטנים, ומשתמשת במיקום מרחבי בתלת־ממד ובדו־ממד. המפתחים הרחיבו כאן את מנוע ה־OCR לתמיכה ב־32 שפות שונות, עם עמידות גבוהה יותר למסמכים מטושטשים, תאורה חלשה או טקסט נטוי, לצד שיפורים מורגשים בהסקה לוגית ומתמטית מתוך תמונות.

מתאים ל

  • חילוץ מידע מקבלות ומסמכים

    מנוע ה־OCR המורחב מתמודד היטב עם סריקות עקומות, תאורה ירודה וטבלאות צפופות ישירות למבנה נתונים.

  • אוטומציה של ממשקי משתמש

    זיהוי אלמנטים גרפיים במסכי מחשב וטלפון לצורך בדיקות תוכנה והפעלת כלים חיצוניים.

  • המרת תרשימים לקוד

    תרגום צילומי מסך ותרשימי זרימה ישירות לקבצי Draw.io או שלד של HTML ו־CSS.

איפה זה נופל

זה עדיין מודל של שני מיליארד פרמטרים, ובסוף הפיזיקה מנצחת. למרות שהוא מתוכנן לקודד מסמכים מורכבים וסרטונים ארוכים, רמת הדיוק וההסקה שלו במשימות עמוקות נמוכה משמעותית מגרסאות ה־32B של הסדרה. בבדיקות שלכם כדאי לבחון היטב הזיות בעברית ופענוח נכון של מונחים טכניים עמוסים, כי כרטיס המודל לא מפרט אילו שפות נכללות ב־32 הנתמכות ב־OCR.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל תומך בעברית כשמחלצים טקסט מתמונה?

הכרטיס מציין תמיכה ב־32 שפות עבור OCR אבל לא מפרט את הרשימה המלאה. מומלץ להריץ בדיקה על כמה דוגמאות סרוקות בעברית לפני שמסתמכים עליו לייצור.

כמה זיכרון כרטיס מסך נחוץ בשביל הקשר ארוך?

המשקלים עצמם דורשים כ־4 גיגה, אבל ניצול של מאות אלפי טוקנים בווידאו או במסמכים יזלול זיכרון נוסף עבור ה־KV cache, כך שתצטרכו כרטיס מרווח יותר.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.0 גיגה־בייט, כך שתוכלו להריץ אותו בלי בעיה על כרטיס מסך ביתי בסיסי עם 6 עד 8 גיגה זיכרון, או אפילו על מעבד של מחשב נייד חזק. כדי להשתמש בו בספריית transformers צריך להתקין את גרסת הפיתוח העדכנית ישירות מגיטהאב, כי התמיכה בארכיטקטורה הזו חדשה מדי לגרסאות יציבות ישנות.

אם אתם צריכים רק בדיקה מהירה פה ושם, הרימו ספייס או השתמשו ב־API קיים במקום להסתבך עם סביבות פיתוח והגדרות ידניות של משתני צירוף וטמפרטורה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-2B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא וחופשי. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצרים סגורים ולהפיץ אותם, בתנאי ששומרים על הצהרת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗