GPT
Q

Qwen3-VL-2B-Thinking

קוד פתוח

Qwenapache-2.02025-10-19

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

דגם חזותי קטן שמשלב תהליכי חשיבה עמוקים עם חלון הקשר ענק. הוא מתאים למי שרוצה להריץ מקומית ניתוח תמונות ומסמכים מורכבים בלי לשלם על שרתי ענק.

  • 2.1Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.0 GBמשקל הקבצים
  • 74,195הורדות בחודש

מה זה

מדובר במודל שמשלב ראייה ממוחשבת וטקסט ומכוון לפתרון בעיות שדורשות היגיון, כמו מתמטיקה, ניתוח קוד מתוך צילומי מסך והבנת ממשקים גרפיים. הוא מביא יכולות של סוכן חזותי להפעלת מחשב ומכשירים ניידים, ומסוגל לייצר קוד כמו HTML או Draw.io ישירות מתוך תמונה או וידאו.

ההבדל המשמעותי לעומת מודלים אחרים בקטגוריית שני מיליארד פרמטרים הוא התוספת של מנגנון החשיבה המובנה, לצד חלון הקשר עצום של 256 אלף טוקנים. הוא כולל תמיכה ב־OCR ב־32 שפות ומבנה פנימי שמשלב תכונות וידאו ומצלמה לטובת הבנה מרחבית ומיקום אירועים על ציר הזמן.

מתאים ל

  • אוטומציה של ממשקי משתמש

    זיהוי כפתורים ואלמנטים בצילומי מסך כדי להפעיל תוכנות ומערכות באופן אוטונומי.

  • המרת עיצובים לקוד

    קריאת סקיצות או צילומי מסך ותרגום ישיר שלהם לקוד תצוגה כמו HTML, CSS ו־Draw.io.

  • חילוץ נתונים ממסמכים קשים

    פענוח טקסט מתמונות מטושטשות, צילומים בזווית ומסמכים ארוכים באמצעות OCR משודרג.

איפה זה נופל

גודל של 2.1 מיליארד פרמטרים מציב רף עליון ליכולת ההכללה שלו, ומודל בגודל כזה עדיין מועד להזיות במשימות מורכבות. גרסת ה־Thinking מייצרת פלטים ארוכים מאוד שכוללים את שלבי ההסבר, מה שמאט את קצב הפקת התשובה הסופית. בנוסף, למרות ההרחבה ב־OCR, הכרטיס לא מציין תמיכה מפורשת בעברית, ולכן חובה לבדוק אותו מראש על מסמכים מקומיים.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל תומך בעברית?

כרטיס המודל מפרט תמיכה ב־OCR עבור 32 שפות, אך אינו מציין במפורש אילו שפות נתמכות. צריך לבדוק אותו באופן מעשי על טקסט עברי כדי לוודא דיוק.

מה המשמעות של גרסת Thinking בהרצה יומיומית?

המודל מייצר שלבי מחשבה מפורטים לפני שהוא פולט את התשובה הסופית. זה משפר את הדיוק בלוגיקה ובמתמטיקה, אבל דורש מכסת טוקנים גבוהה יותר ליציאה ומאריך את זמן ההמתנה.

איך מריצים

במשקל של ארבעה גיגה־בייט בלבד, קל מאוד להריץ אותו מקומית על כרטיס מסך ביתי בסיסי או אפילו על מעבד של מחשב נייד חזק דרך ספריית transformers. אין צורך בתשתית מורכבת ויקרה של שרתים ארגוניים כדי לקבל זמני תגובה טובים.

ההתקנה דורשת משיכה ישירה של transformers מקוד המקור בגיטהאב כי התמיכה בארכיטקטורה שלו טרייה. אם המטרה היא לעבד חלונות הקשר ענקיים של שעות וידאו בבת אחת, כדאי לשקול קריאה לשירות ענן מנוהל, כי הזיכרון הנדרש לקונטקסט המלא יחנוק כרטיסים צנועים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-2B-Thinking")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המודל והפצה שלו בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗