GPT
Q

Qwen3-VL-32B-Instruct

קוד פתוח

Qwenapache-2.02025-10-19

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל ויזואלי של 33 מיליארד פרמטרים שמציע חלון הקשר עצום ויכולות ניתוח וידאו ממושך. הוא מתאים למי שצריך לפענח מסמכים מורכבים או סרטונים ארוכים בלי להסתמך על שירותי ענן סגורים.

  • 33Bפרמטרים
  • 262,144טוקנים בהקשר
  • 62.1 GBמשקל הקבצים
  • 401,012הורדות בחודש

מה זה

מדובר במודל מולטימודלי שמחבר ראייה ממוחשבת עם הבנת שפה ברמה של מודלים טקסטואליים ייעודיים. הוא בנוי לעבד תמונות, וידאו וטקסט יחד, וכולל ארכיטקטורה שמשלבת קידוד מיקום בזמן ובמרחב כדי להבין רצפים ארוכים ופרטים קטנים בתמונה. המערכת מסוגלת לחלץ טקסט ב־32 שפות שונות, גם בתנאי צילום קשים כמו טשטוש או זוויות עקומות, ולפרק ממשקי משתמש לפעולות קוד או רכיבי ממשק.

ההבדל המשמעותי מול משקלים דומים בקטגוריה הוא היכולת לטפל בהקשר של 262,144 טוקנים, מה שמאפשר להזין לו ספרים שלמים או שעות של וידאו עם יכולת איתור אירועים לפי נקודות זמן מדויקות. בנוסף, שילבו בו יכולות מיקום במרחב דו־ממדי ותלת־ממדי, שנועדו להבנת יחסי גומלין בין חפצים ומבנה של סביבות פיזיות.

מתאים ל

  • ניתוח מסמכים טכניים וסריקות

    מנוע ה־OCR המשודרג מתמודד עם טשטוש, זוויות קשות וטקסט מקצועי ב־32 שפות שונות.

  • תחקור סרטוני וידאו ארוכים

    חלון של 256K טוקנים וצימוד חותמות זמן מאפשרים לאתר אירועים ספציפיים לאורך שעות צילום.

  • המרת עיצובים לקוד ממשק

    היכולת הוויזואלית תומכת בפענוח ממשקי משתמש ותרגומם לקוד HTML, CSS או תרשימי Draw.io.

איפה זה נופל

גודל המודל יוצר צוואר בקבוק חמור בזמני תגובה ובמשאבים, במיוחד אם מנצלים את מלוא חלון ההקשר או מזינים סרטונים ארוכים. הכרטיס מציג שיפורים באיתור נתונים ו־OCR, אך תמיכת השפות מוגבלת ל־32 בלבד, וללא בדיקה מוקדמת אי אפשר להסתמך על דיוק הקריאה בשפות שאינן ברשימה המרכזית. בנוסף, יכולות הפעלת הסוכנים והממשקים דורשות שילוב מורכב של כלי צד שלישי, ולא מדובר בפתרון שעובד ישר מהקופסה בלי מעטפת פיתוח משמעותית.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איזה כרטיס מסך מינימלי דרוש כדי להריץ את המודל?

הקבצים שוקלים כ־62 גיגה־בייט, ולכן דרוש זיכרון וידאו של 80 גיגה־בייט לפחות להרצה בסיסית. כרטיס H100 בודד או שני כרטיסי A100 של 40 גיגה־בייט יספיקו, אך לניצול מלא של ההקשר תצטרכו זיכרון נרחב בהרבה.

האם הוא יכול להחליף מודל שפה רגיל למשימות טקסט?

כן, המבנה שלו מותאם להבנת טקסט מלאה לצד עיבוד התמונה. הוא מסוגל לבצע ניתוחים לוגיים, כתיבת קוד ומענה על שאלות בדיוק כמו מודל טקסט ייעודי בגודל זהה.

איך מריצים

המשקלים תופסים 62.1 גיגה־בייט בזיכרון, כך שאי אפשר להריץ אותו על כרטיס ביתי רגיל. להרצה מקומית בגרסה המקורית תצטרכו לפחות שרת עם שני כרטיסי A100 או H100 כדי להחזיק את המודל ואת חלון ההקשר הארוך בלי קריסות זיכרון. הקוד דורש התקנה של ספריית transformers ישירות ממאגר הפיתוח בגיטהאב, כי הגרסה הרשמית שליוותה את ההשקה טרם יצאה בערוץ הרגיל.

אם אין לכם תשתית ענן ייעודית עם חומרה מתאימה, עלויות התחזוקה והחשמל של שרת כזה יהפכו את ההרצה העצמית ללא משתלמת. במקרים של בדיקות היתכנות או עומסי עבודה נמוכים, קריאה ל־API חיצוני זולה ופשוטה בהרבה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-32B-Instruct")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗