GPT
Q

Qwen3-VL-8B-Instruct-FP8

קוד פתוח

Qwenapache-2.02025-10-11

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת FP8 מכווצת למודל ראייה וטקסט של 8.8 מיליארד פרמטרים, שמיועדת למי שרוצה חלון הקשר עצום ויכולות ניתוח וידאו וממשקים בלי לשרוף כרטיסי מסך יקרים.

  • 8.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 9.9 GBמשקל הקבצים
  • 2,453,732הורדות בחודש

מה זה

מדובר במודל רב-מודאלי שמקבל תמונות, וידאו וטקסט ומחזיר טקסט, שעבר קוונטיזציה מובנית לרמת FP8 בבלוקים של 128 כדי לשמור על ביצועים כמעט זהים למקור ב־BF16. הוא מתמחה בפעולות סוכן על ממשקי מחשב וטלפון, הבנת מיקומים במרחב בתלת-ממד, חילוץ טקסט מתמונות ב־32 שפות וניתוח שעות של וידאו עם חותמות זמן מדויקות.

השילוב של ארכיטקטורת DeepStack לחיבור פרטים דקים מהתמונה יחד עם Interleaved-MRoPE מאפשר לו לטפל בחלון הקשר טבעי של 256K טוקנים. זה אומר שאפשר להזין לו מסמכים שלמים או סרטונים ארוכים בלי לאבד את ההקשר בין תחילת הקובץ לסופו.

מתאים ל

  • אוטומציה של ממשקים

    זיהוי אלמנטים על מסכי מחשב או מובייל והפעלת כלים ישירות מהתמונה כסוכן עצמאי.

  • ניתוח וידאו ארוך

    תמיכה בחלון הקשר עצום ואינדוקס מדויק של אירועים לפי חותמות זמן לאורך שעות.

  • המרת עיצובים לקוד

    יצירת קבצי HTML, CSS או דיאגרמות Draw.io מתוך צילומי מסך וסקיצות.

איפה זה נופל

למרות הקוונטיזציה המוצלחת, טעינה סטנדרטית דרך transformers פשוט חסומה כרגע, מה שמחייב אתכם להרים סביבת הרצה נפרדת של vLLM או SGLang. בנוסף, חילוץ הטקסט הוגבל ל־32 שפות בלבד, כך שאם אתם בונים על עברית מורכבת במסמכים סרוקים, תצטרכו לבדוק את זה ידנית כי אין הבטחה ליציבות מעבר לשפות הנפוצות שנבדקו.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

אפשר לטעון את המודל הזה כרגיל עם ספריית transformers?

לא. המפרסמים ציינו מפורשות שהגרסה הנוכחית של transformers אינה תומכת בטעינת המשקלים הללו ישירות. כדי להריץ אותו יש להשתמש ב־vLLM או ב־SGLang.

האם הקוונטיזציה ל־FP8 פגעה ביכולות של המודל לעומת המקור?

המדדים מראים שהביצועים כמעט זהים לחלוטין למודל המקורי ב־BF16. בזכות שימוש בבלוקים בגודל 128, חוסכים נפח זיכרון יקר בלי לאבד כושר הבנה או דיוק ביצירת טקסט.

איך מריצים

המשקל הכולל של הקבצים עומד על 9.9 גיגה-בייט, כך שאפשר להריץ אותו בנוחות על כרטיס מסך בודד עם 16GB זיכרון לפחות, בתנאי שמשתמשים במנועים ייעודיים כמו vLLM או SGLang שתומכים בפורמט. אם תנסו לטעון אותו ישירות דרך ספריית transformers הרגילה, זה ייכשל כי התמיכה במשקלים האלה עדיין לא מובנית שם.

הבחירה בגרסת ה־FP8 חוסכת זיכרון ומאיצה את הריצה בלי להקריב דיוק כמעט בכלל לעומת משקלי ה־BF16 המלאים. אם השרת שלכם חלש מדי, או אם אין לכם חומרה ייעודית עם תמיכה בהאצת FP8, עדיף לפנות ל־API חיצוני במקום להסתבך עם ביצועים נמוכים מקומית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-8B-Instruct-FP8")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי הקוד והפצה של המודל בתוך המוצר שלכם. התנאי היחיד הוא שמירת הודעת הרישיון ומתן קרדיט ליוצרים המקוריים, בלי דרישות לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗