GPT
Q

Qwen3-VL-30B-A3B-Thinking

קוד פתוח

Qwenapache-2.02025-09-30

  • transformers
  • safetensors
  • qwen3_vl_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

זה מודל ראייה ושפה מבוסס תערובת מומחים עם מנגנון חשיבה מובנה. הוא מיועד למי שצריך ניתוח עמוק של תמונות, מסמכים ארוכים וסרטונים של שעות בלי לוותר על הסקת מסקנות לוגית.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 57.9 GBמשקל הקבצים
  • 12,657הורדות בחודש

מה זה

מדובר במודל שמשלב טקסט ותמונה בארכיטקטורת תערובת מומחים, עם כ־31 מיליארד פרמטרים בסך הכול שמתוכם רק חלק קטן פעיל בכל רגע. גרסת החשיבה הזו מתמקדת בניתוח רב־שלבי, מה שמתאים לפתרון בעיות מתמטיקה ומדעים על גבי דיאגרמות, לצד הפקת קוד ישירות מסקיצות או ממשקים.

היתרון המרכזי כאן הוא חלון הקשר עצום של 262,144 טוקנים, שמאפשר להזין וידאו מלא או ספרים שלמים יחד עם תמונות ברצף אחד. המודל מתמחה במיקום מרחבי בתלת־ממד, הפעלת ממשקי מחשב וטלפון כסוכן, וזיהוי טקסט ב־32 שפות שונות גם בתנאי צילום קשים, טשטוש או מסמכים מורכבים.

מתאים ל

  • אוטומציה של ממשקים

    זיהוי אלמנטים על מסך מחשב או נייד והפעלת פעולות במערכת כסוכן אוטונומי.

  • המרה של עיצוב לקוד

    קריאת צילומי מסך ותרשימים ותרגום ישיר שלהם לרכיבי ממשק ב־HTML, CSS וקוד.

  • תחקור וידאו ומסמכים

    סריקת הקלטות באורך שעות ומסמכים ארוכים בזכות חלון הקשר של 262 אלף טוקנים.

איפה זה נופל

למרות השדרוג בזיהוי טקסט, הכרטיס מציין תמיכה ב־32 שפות בלבד, כך שעברית לא בהכרח מקבלת כאן דיוק מושלם במסמכים מורכבים ומחייבת בדיקה מקדימה. בנוסף, מודלים שכוללים מנגנון חשיבה מייצרים זמן תגובה ראשוני ארוך יחסית, ולא יתאימו למערכות שדורשות מענה מיידי בזמן אמת. ניתוח וידאו באורך שעות אמנם נתמך, אך ניצול מלוא חלון ההקשר יחנוק את משאבי החומרה מהר מאוד.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב אישי רגיל?

לא. משקל הקבצים לבדו מגיע ל־57.9 גיגה־בייט, וכדי לטעון ארכיטקטורה של 31 מיליארד פרמטרים דרוש שרת עם כרטיסי מסך מקצועיים בעלי נפח זיכרון גבוה במיוחד.

מה ההבדל בין גרסה זו לגרסת Instruct רגילה?

מהדורת Thinking כוללת תהליך הסקת מסקנות מובנה שבו המודל מנתח את הבעיה לעומק לפני מתן התשובה, דבר שמשפר תוצאות במשימות היגיון ומתמטיקה על חשבון מהירות היצירה.

איך מריצים

כדי להריץ אותו מקומית תצטרכו להתמודד עם משקל קבצים של 57.9 גיגה־בייט. זה אומר שכרטיס מסך ביתי יחיד לא יספיק פה, ותצטרכו לפחות מערך של שני כרטיסי A100 או H100 כדי להחזיק את המשקלים ואת חלון ההקשר הענק בזיכרון, אפילו שמדובר בארכיטקטורת מומחים חסכונית יותר בחישוב.

הקוד דורש התקנה של ספריית transformers ישירות ממאגר הגיטהאב כי התמיכה בארכיטקטורה הזו חדשה מדי. אם אין לכם שרת ייעודי זמין עם מספיק זיכרון וידאו, עדיף בהרבה להשתמש בנקודת קצה מנוהלת במקום להסתבך עם פריסה פיזית של 25 קבצי משקלים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-30B-A3B-Thinking")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים משוחררים תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המודל והפצה שלו בתוך מוצרים פנימיים או שירותים ללקוחות, בתנאי ששומרים על הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗