GPT
Q

Qwen3-VL-8B-Instruct

קוד פתוח

Qwenapache-2.02025-10-11

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

שילוב של ראייה וטקסט במשקל שמונה מיליארד פרמטרים שרץ על כרטיס בודד. הוא נותן חלון הקשר ענקי של 262 אלף טוקנים לניתוח וידאו ומסמכים כבדים.

  • 8.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 16.3 GBמשקל הקבצים
  • 15,231,494הורדות בחודש

מה זה

הגרסה הזו מתמקדת בעיבוד תמונה, וידאו וטקסט בארכיטקטורה דחוסה של שמונה מיליארד פרמטרים. היא תוכננה לשמש כסוכן ויזואלי שמסוגל לתפעל ממשקי משתמש במחשב ובטלפון, לקרוא רכיבים ולתרגם עיצובים לקוד כמו דפי אינטרנט או תרשימים. השדרוג המשמעותי כאן נוגע להבנה מרחבית בתלת מימד וזיהוי יחסי מיקום בין עצמים בתמונה.

בגזרת הטקסט והמסמכים הוסיפו יכולות פענוח תווים ב־32 שפות שונות, עם עמידות לצילומים מטושטשים או מסמכים בעייתיים בתאורה חלשה. התמיכה במיליוני טוקנים נועדה לאפשר הזנה של סרטונים בני שעות בלי לאבד אירועים נקודתיים בציר הזמן, בזכות מנגנון קידוד מיקום שמתחשב בזמן, בגובה וברוחב.

לעומת גרסאות קודמות בקטגוריית המשקל הזו, המודל משלב שכבות ראייה עמוקות כדי לא לפספס פרטים קטנים בתמונות ברזולוציה גבוהה. הוא לא מסתפק רק בזיהוי כללי של אובייקטים פופולריים ותרשימים, אלא אמור להבין נימוקים מתמטיים מורכבים ותרשימים מדעיים בלי להזדקק למודל שפה נפרד לעיבוד התוכן.

מתאים ל

  • חילוץ נתונים מסריקות קשות

    מנוע הראייה שלו מתמודד עם צילומים עקומים, תאורה חלשה וטקסטים ארוכים שדורשים הבנת מבנה.

  • המרת צילומי מסך לקוד

    הוא מזהה רכיבי ממשק ומסוגל להוציא ישירות קוד HTML, CSS ותרשימים מתוך תמונות מסך.

  • תחקור סרטונים ארוכים

    חלון ההקשר הגדול מאפשר לאתר אירועים בתוך וידאו לפי נקודת זמן מדויקת בלי לחתוך מקטעים.

איפה זה נופל

חלון הקשר של 256 אלף טוקנים נשמע מפתה, אבל בפועל עיבוד סרטונים שלמים או מסמכים ענקיים יגרור זמני תגובה איטיים מאוד על חומרה מקומית. למרות ההבטחה לזיהוי של 32 שפות בטקסט חזותי, הכרטיס לא מפרט את רשימת השפות המדויקת, כך שחובה לבדוק איכות פענוח בעברית לפני שמסתמכים עליו. בנוסף, תפעול ממשקים וסוכנים אוטונומיים עדיין נוטה לטעויות בלחיצות וזיהוי כפתורים במערכות אמיתיות.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

אפשר להריץ אותו על מחשב נייד סטנדרטי?

לא. נדרש כרטיס גרפי ייעודי עם נפח זיכרון משמעותי כדי לטעון 16.3 גיגה של קבצים ולהשאיר מקום לפענוח התמונות. מחשב רגיל בלי מעבד גרפי מתאים פשוט יקרוס מחוסר זיכרון.

האם הוא מזהה כתב יד ומסמכים בעברית?

הכרטיס מצהיר על תמיכה ב־32 שפות שונות לפענוח תווים, אך אינו מפרט האם עברית נכללת ביניהן. תצטרכו להריץ בדיקה ידנית על דוגמאות שלכם כדי לוודא שהוא לא מייצר אותיות שגויות.

איך מריצים

המשקלים תופסים 16.3 גיגה בייט, כך שתצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון כדי להריץ אותו בלי לחנוק את המערכת. אם אתם מתכננים לנצל את מלוא חלון ההקשר או לטעון סרטונים ארוכים, תצטרכו כמות זיכרון גדולה בהרבה או שימוש בכימות, אחרת תקבלו שגיאות זיכרון מהר מאוד.

כדי לעבוד איתו צריך להתקין את ספריית transformers ישירות ממאגר הקוד של גיטהאב, כי הגרסה הרשמית עדיין לא כוללת את התמיכה במבנה שלו. מי שצריך מענה מהיר וזול למשימות נקודתיות בלי להחזיק שרת ייעודי דלוק ברקע יעדיף לפנות ל־API חיצוני במקום להתעסק בתחזוקה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-8B-Instruct")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין. מותר לכם לשנות את הקוד והמשקלים, להטמיע אותם במוצר סגור ולהפיץ אותו ללקוחות, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗