GPT
Q

Qwen3-VL-32B-Thinking

קוד פתוח

Qwenapache-2.02025-10-19

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת חשיבה למודל ראייה ושפה שכוללת 33 מיליארד פרמטרים. היא מיועדת למי שצריך היקש לוגי מעמיק על תמונות, וידאו ארוך וממשקי משתמש.

  • 33Bפרמטרים
  • 262,144טוקנים בהקשר
  • 62.1 GBמשקל הקבצים
  • 12,843הורדות בחודש

מה זה

מדובר במודל שמשלב ראייה וטקסט עם תהליכי חשיבה מורכבים במיוחד. הוא מנתח תמונות, מפעיל ממשקי מחשב וסלולר, מייצר קוד ומפענח וידאו ברמת דיוק של שניות. המבנה שלו כולל מנגנונים ששומרים על יציבות הזמנים בווידאו ומשלבים שכבות ויזואליות שונות כדי לחלץ פרטים דקים.

בגזרה הטקסטואלית והחזותית הוא כולל הרחבה של זיהוי טקסט בתמונות ל־32 שפות, התמודדות עם תנאי צילום קשים ותפיסה מרחבית דו־ממדית ותלת־ממדית. הדגש כאן הוא לא על תשובה מהירה וקצרה, אלא על הסקת מסקנות מונחית ראיות בתחומי מדעים ומתמטיקה.

מתאים ל

  • סוכן חזותי להפעלת ממשקים

    זיהוי אלמנטים על מסכי מחשב ונייד, הבנת תפקידם והפעלת כלים לביצוע פעולות.

  • ניתוח וידאו ארוך ומסמכים

    עיבוד ספרים שלמים ושעות של וידאו באמצעות הקשר של 262,144 טוקנים ואחזור מדויק.

  • המרת עיצובים לקוד

    יצירת קבצי Draw.io וקוד HTML, CSS ו־JS ישירות מתוך תמונות או קטעי וידאו.

  • פתרון בעיות מדעיות מורכבות

    היקש לוגי רב־שלבי וניתוח סיבתי מבוסס ראיות עבור שאלות מתמטיקה ומדעים.

איפה זה נופל

חלון הקשר העצום ומנגנון החשיבה דורשים כמויות אדירות של זיכרון ומייצרים זמני תגובה ארוכים. תהליך החשיבה מגדיל את כמות הטוקנים שנוצרים בכל תשובה, מה שהופך אותו ללא מתאים ליישומים שדורשים זמן אמת או תגובה מיידית למשתמש. תמיכת שפות המקור הורחבה ל־32 שפות בלבד, ולכן צריך לבחון היטב את איכות זיהוי הטקסט בתמונות שכוללות עברית לפני שילוב שלו במערכת.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך בודד?

קבצי המודל שוקלים 62.1 גיגה בייט לפני חישובי ההקשר. כדי לטעון אותו ולהשתמש בחלון הטוקנים המלא, תצטרכו שרת עם זיכרון גרפי גבוה בהרבה ממה שיש בכרטיסים סטנדרטיים.

מה המשמעות של גרסת Thinking לעומת גרסה רגילה?

גרסה זו מייצרת שרשרת חשיבה פנימית לפני הפקת התשובה. הדבר מאפשר לו לפתור בעיות מורכבות במדעים ובתפיסה מרחבית, אך גורם לזמן יצירת הפלט להיות ארוך יותר.

איזו גרסת תוכנה דרושה להרצה מקומית?

הכרטיס ממליץ להתקין את transformers ישירות ממאגר הגיטהאב כדי לקבל תמיכה בארכיטקטורה זו, מאחר שהיא דורשת עדכונים שטרם הופצו בגרסאות הישנות.

איך מריצים

המשקל הכולל של הקבצים עומד על 62.1 גיגה בייט, כך שאי אפשר להריץ אותו על כרטיס ביתי פשוט. תצטרכו שרת עם זיכרון גרפי נרחב מאוד כדי להחזיק את המודל עצמו לצד חלון הקשר של 262,144 טוקנים, שיכול להתרחב עד מיליון.

ההרצה מתבצעת ישירות דרך ספריית transformers, כאשר ההמלצה היא להתקין ישירות ממאגר הקוד של הפרויקט. אם אין לכם תשתית שרתים ייעודית שתומכת בעומס כזה, החזקה עצמית תהיה יקרה וכבדה ביחס לפנייה לשירות מרוחק שמגיש אותו.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-32B-Thinking")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי והפצה של המשקלים בחינם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗