GPT
Q

Qwen3-VL-8B-Thinking

קוד פתוח

Qwenapache-2.02025-10-11

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל ראייה ושפה קומפקטי שמביא יכולות חשיבה עמוקה וניתוח וידאו ממושך. הוא מתאים למי שצריך לפענח מסמכים מורכבים או להפעיל סוכני ממשק בלי להסתמך על עננים סגורים.

  • 8.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 16.3 GBמשקל הקבצים
  • 113,916הורדות בחודש

מה זה

מדובר בגרסת החשיבה המחוזקת של סדרת הראייה מבית Qwen, עם כמעט 8.8 מיליארד פרמטרים. המודל מתמקד בניתוח משולב של תמונה, וידאו וטקסט, ומציע תמיכה בהקשר מקורי של 262,144 טוקנים שניתן להרחבה עד מיליון. זה אומר שאפשר להזין לו שעות של וידאו או ספרים שלמים עם תמונות ולקבל איתור אירועים ברמת השנייה הבודדת.

השוני המרכזי מול מה שהכרנו בגדלים האלה טמון ביכולת ההסקה הלוגית ובארכיטקטורה. הוא כולל מנגנוני מיקום בזמן ומרחב לצד מיזוג שכבות ויזואליות עמוקות. היכולות האלה מכוונות לפענוח מתמטיקה, הבנת עומק תלת מימדית, הפעלת ממשקי משתמש במחשב ובנייד, ותרגום סקיצות לקוד כמו דפי אינטרנט או תרשימים.

מתאים ל

  • אוטומציה של ממשקי משתמש

    זיהוי אלמנטים גרפיים במסכי מחשב וטלפון והפעלת כלים לצורך השלמת משימות מורכבות.

  • המרת תרשימים לקוד

    יצירת קוד של דפי אינטרנט, תבניות עיצוב ותרשימים ישירות מצילומי מסך או קטעי וידאו.

  • תחקור וידאו ממושך

    ניתוח הקלטות של שעות ארוכות ואיתור נקודות זמן מדויקות לפי שאילתות טקסטואליות.

איפה זה נופל

בגלל שמדובר במודל חשיבה, אורך הפלט המומלץ בהגדרות מגיע לעשרות אלפי טוקנים, מה שאומר שזמני התגובה יכולים להיות איטיים מאוד בהשוואה למודלים רגילים. המפתחים לא ציינו במפורש האם עברית נכללת בתוך 32 השפות הנתמכות במנגנון הראייה, כך שצריך לבדוק היטב דיוק של טקסט מקומי ומסמכים סרוקים בעברית. בנוסף, חילוץ פרטים מתמונות מטושטשות או בעלות זוויות חדות עדיין דורש אימות זהיר לפני שמשלבים אותו בזרימת עבודה קריטית.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל תומך בעברית בזיהוי טקסט מתמונות?

הכרטיס מציין תמיכה ב־32 שפות עבור פענוח טקסט, אך רשימת השפות המלאה אינה מפורטת. מומלץ לבדוק דוגמאות של מסמכים מקומיים לפני שמסתמכים עליו בעברית.

למה נדרש חלון פלט של עשרות אלפי טוקנים?

זהו מודל מסוג Thinking, שמייצר תהליכי חשיבה ארוכים ומפורטים לפני מתן התשובה. הגדרות היצרן מכוונות לשרשראות היסק ארוכות שמסבירות את הצעדים המתמטיים והלוגיים.

איך מריצים

המשקלים תופסים 16.3 גיגה בייט ומחולקים לשישה עשר קבצים, מה שדורש כרטיס מסך עם לפחות 24 גיגה בייט של זיכרון כדי להריץ אותם בנוחות לפני שמבצעים כימות. כדי לעבוד איתו צריך להתקין את ספריית transformers ישירות ממאגר הגיט, מכיוון שהגרסה הרשמית שתומכת בארכיטקטורה עדיין לא שוחררה בעת פרסום המודל.

אם אתם מתכננים להעמיס סרטוני וידאו ארוכים שמנצלים את מלוא חלון ההקשר, צריכת הזיכרון תזנק הרבה מעבר לגודל המשקלים הבסיסי. במקרים של עומסים כבדים או כשאין לכם חומרה ייעודית מקומית, עדיף להשתמש בנקודת קצה מנוהלת דרך שירותי ענן ולא להסתבך עם ניהול זיכרון ידני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-8B-Thinking")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה של המודל או מוצרים המבוססים עליו, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗