GPT
Q

Qwen3-VL-30B-A3B-Instruct-FP8

קוד פתוח

Qwenapache-2.02025-10-01

  • transformers
  • safetensors
  • qwen3_vl_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת של מודל תמונה וטקסט עם ארכיטקטורת מומחים וחלון ענק. מתאימה למי שרוצה להריץ סוכן ויזואלי או ניתוח וידאו ארוך בלי לחנוק את השרת.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 30.1 GBמשקל הקבצים
  • 595,640הורדות בחודש

מה זה

מדובר במודל רב תכליתי שמשלב ראייה וטקסט על בסיס ארכיטקטורת תערובת מומחים של 31 מיליארד פרמטרים. הגרסה הזו עברה כיול לדיוק שמונה ביט כדי להקטין את נפח הזיכרון, כשהיוצרים טוענים שהביצועים כמעט זהים למקור. הוא מיועד לניתוח מעמיק של תמונות ומסמכים, תומך בזיהוי תווים בשלושים ושתיים שפות שונות, ומסוגל לעבד וידאו ארוך הודות לחלון הקשר בסיסי של 256 אלף טוקנים שניתן להרחבה עד מיליון.

ההבדל המשמעותי לעומת מודלים קודמים בסדר גודל כזה הוא המיקוד בסוכנים ובמרחב. הוא מתוכנן לתפעל ממשקי משתמש של מחשב וטלפון, כולל הבנת כפתורים והפעלת כלים. בנוסף יש לו הבנה מרחבית של מיקומי עצמים והסתרות, יכולת חילוץ קוד עיצוב מתמונות, ומיקום אירועים בווידאו לפי חותמות זמן מדויקות.

מתאים ל

  • סוכן ממשק משתמש

    זיהוי אלמנטים במסכי מחשב ונייד והפעלת כלים ישירות מהתמונה.

  • ניתוח וידאו ממושך

    איתור אירועים לפי זמן ספציפי מתוך שעות הקלטה בזכות חלון עצום.

  • יצירת קוד מעיצובים

    המרת תרשימים וצילומי מסך לקוד אתרים או דיאגרמות מוכנות.

איפה זה נופל

הכרטיס מדגיש יכולות מתקדמות אבל שותק לגבי נקודות כשל מוגדרות. עם זאת, התמיכה בזיהוי טקסט מוצהרת עבור 32 שפות בלבד, ולכן חובה לבדוק איכות בעברית לפני שמסתמכים עליו למסמכים מקומיים. בנוסף, חוסר התמיכה הישיר בספריית טרנספורמרס הרגילה יוצר תלות מיידית במנועי הסקה ייעודיים, מה שמסבך את האינטגרציה הראשונית במוצר קיים.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

אפשר להריץ אותו ישר מסקריפט פייתון בסיסי של טרנספורמרס?

לא. נכון לעכשיו הספרייה לא תומכת בטעינה ישירה של המשקלים האלה. תצטרכו להרים שרת באמצעות vLLM או SGLang לפי ההנחיות של המפתחים.

האם הדחיסה לשמונה ביט פוגעת באיכות התשובות לעומת המודל המקורי?

לפי נתוני המפתחים, שיטת הכיווץ עובדת בבלוקים קטנים ומציגה מדדים כמעט זהים לחלוטין לגרסת המשקל המלא. ההבדל בתוצאות אמור להיות בלתי מורגש ברוב המשימות.

איך מריצים

המשקלים תופסים כ־30.1 גיגה בייט ומחולקים לשישה עשר קבצים. כדי להריץ אותו מקומית חייבים כרטיס גרפי מודרני שתומך בחישובי שמונה ביט וכולל לפחות 40 עד 48 גיגה זיכרון וידאו פנוי, או שרת עם מספר כרטיסים, במיוחד אם רוצים לנצל את חלון ההקשר הגדול.

שימו לב שבספריית טרנספורמרס הרגילה אין תמיכה ישירה בטעינת המשקלים האלה כרגע. הפריסה בפועל דורשת מנועים כמו vLLM או SGLang. אם אין לכם גישה לכרטיסים מקצועיים או שאתם לא רוצים להגדיר סביבות ייעודיות, זול ופשוט יותר לגשת אליו דרך שירות ענן חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-30B-A3B-Instruct-FP8")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון אפאצ׳י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗