GPT
Q

Qwen3-VL-30B-A3B-Thinking-FP8

קוד פתוח

Qwenapache-2.02025-10-01

  • transformers
  • safetensors
  • qwen3_vl_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל ראייה ושפה בתצורת תערובת מומחים עם חשיבה מעמיקה, שמגיע מכווץ ישירות לפורמט שמונה ביט. הוא מיועד לניתוח וידאו ממושך, הפעלת ממשקים ופענוח מסמכים מורכבים.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 30.1 GBמשקל הקבצים
  • 15,341הורדות בחודש

מה זה

מדובר בגרסת שמונה ביט מסוג תערובת מומחים עם שלושים ואחד מיליארד פרמטרים כוללים, שמתוכם פעילים רק חלק בכל ריצה. המודל שייך לסדרת החשיבה, כך שהוא מבצע שלבי הסקת מסקנות מפורטים לפני הפלט הסופי בתחומי מדעים, מתמטיקה וניתוח סיבתי. היכולות הוויזואליות שלו כוללות הבנה מרחבית בדו ותלת ממד, זיהוי אובייקטים וממשקים גרפיים, ותרגום ישיר של תמונות לקוד כמו ווב או דיאגרמות.

הוא מטפל בווידאו ארוך ומסמכים עתירי טקסט בזכות חלון הקשר מובנה של מאתיים חמישים ושישה אלף טוקנים שניתן להרחבה עד מיליון. מערכת המיקום שלו משלבת תגיות זמן לטקסט כדי לבודד רגעים מדויקים בווידאו ברמת השנייה. מנגנון חילוץ הטקסט תומך בשלושים ושתיים שפות, ומתמודד עם טקסטים מטושטשים, מסמכים נטויים ומונחים מקצועיים.

מתאים ל

  • אוטומציה בממשקי משתמש

    זיהוי אלמנטים גרפיים על מסכי מחשב ונייד, הבנת הפעולות הנדרשות והפעלת כלים ישירות מהתמונה.

  • ניתוח וידאו ממושך

    סריקת שעות של וידאו באיתור אירועים נקודתיים עם הצמדת זמנים מדויקת ברמת השנייה.

  • המרת עיצובים לקוד

    יצירה ישירה של קבצי ווב ודיאגרמות מתוך צילומי מסך ותרשימים ללא צורך בכתיבה ידנית.

איפה זה נופל

הכרטיס מודה במפורש שספריית טרנספורמרס הרגילה לא מסוגלת לטעון את המשקלים הללו כרגע, מה שמחייב שימוש בכלים כמו vLLM או SGLang ומסבך פריסות מהירות. בנוסף, מנוע הראייה תומך בשלושים ושתיים שפות בלבד בחילוץ טקסט מתמונה, והיצרן לא פירט אם עברית נכללת ביניהן. שילוב של מודל שחושב ארוכות יחד עם חלון הקשר של מאות אלפי טוקנים יוצר זמן השהיה גבוה במיוחד עד לקבלת הטוקן הראשון, כך שהוא אינו מתאים למענה מיידי.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות בספריית טרנספורמרס?

לא ברגע זה. התיעוד מציין במפורש שהספרייה אינה תומכת עדיין בטעינת המשקלים הללו. לצורך הרצה מקומית היצרן ממליץ להשתמש במנועים כמו vLLM או SGLang שתומכים בפורמט זה.

כמה משאבי חומרה צריך כדי לעבוד עם חלון ההקשר המלא?

המשקלים לבדם תופסים שלושים נקודה אחת גיגה בייט בזיכרון בפורמט שמונה ביט. פתיחת חלון של מאתיים חמישים ושישה אלף טוקנים בווידאו או מסמכים דורשת עשרות גיגה בייט נוספים לטבלת הזיכרון, כך שכרטיס בודד של עשרים וארבעה גיגה בייט לא יספיק.

איך מריצים

המשקל הכולל של הקבצים עומד על שלושים נקודה אחת גיגה בייט. כדי להריץ אותו מקומית באופן יציב תצטרכו כרטיס גרפי מודרני שתומך בחישובי שמונה ביט עם לפחות ארבעים ושמונה גיגה בייט זיכרון וידאו, במיוחד אם אתם מתכוונים לנצל חלק משמעותי מחלון ההקשר הגדול.

ספריית טרנספורמרס עדיין לא תומכת בטעינה ישירה של המשקלים האלה לפי התיעוד. הדרך להריץ אותו כרגע היא דרך מנועים ייעודיים כמו vLLM או SGLang. אם אין לכם שרת ייעודי כזה פנוי או שהמשימות שלכם נקודתיות, ניהול תשתית כזו בבית יגזול זמן עבודה יקר ועדיף לפנות לנקודת קצה מנוהלת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-30B-A3B-Thinking-FP8")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו מחדש במוצרים סגורים בלי תשלום תמלוגים. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗