GPT
Q

Qwen3-VL-235B-A22B-Instruct-FP8

קוד פתוח

Qwenapache-2.02025-10-01

  • transformers
  • safetensors
  • qwen3_vl_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת FP8 דחוסה למודל ראייה ושפה ענק ברשת מומחים שמפעיל 22 מיליארד פרמטרים בפועל. מתאים למי שחייב לנתח וידאו ארוך, תמונות וסוכני ממשק בתוך שרת פרטי.

  • 236Bפרמטרים
  • 262,144טוקנים בהקשר
  • 221 GBמשקל הקבצים
  • 110,488הורדות בחודש

מה זה

מדובר במודל מולטימטרי שמחזיק 235 מיליארד פרמטרים בסך הכול אבל משתמש ב־22 מיליארד בכל טוקן, כך שהוא רץ מהר יותר ממודלים צפופים בגודל דומה. הוא מקבל טקסט, תמונות ווידאו ומחזיר טקסט. הארכיטקטורה כוללת התאמות כמו שילוב מאפיינים רב שכבתי מהראייה וחיבור ישיר בין טקסט לחותמות זמן בתוך וידאו, מה שמאפשר לו לאתר אירועים מדויקים בציר הזמן ולא רק לתאר מה רואים.

מעבר לזיהוי רגיל, הוא נבנה לפעול כסוכן מול ממשקי מחשב וטלפון, כולל זיהוי כפתורים והפעלת כלים. יש כאן גם תמיכה ב־OCR ל־32 שפות עם עמידות לטשטוש וזוויות קשות, ויכולת לפלוט קוד כמו HTML או Draw.io מתוך צילומי מסך. חלון ההקשר עומד על 262,144 טוקנים, כך שאפשר לדחוף אליו שעות של וידאו או מסמכים ענקיים ברצף.

מתאים ל

  • ניתוח וידאו ארוך בציר זמן

    חיבור ישיר של טקסט לחותמות זמן וחלון של 256K מאפשרים לאתר רגעים ספציפיים ולסכם הקלטות של שעות.

  • אוטומציה של ממשקי משתמש

    הוא מזהה אלמנטים על גבי מסכים של מחשב ונייד, מבין פונקציות ויודע להפעיל כלים להשלמת משימות.

  • חילוץ קוד מסקיצות ומסכים

    יודע לקבל צילום מסך או תרשים ולהמיר אותם ישירות לקוד HTML, CSS, JS או תרשימי Draw.io.

איפה זה נופל

הכרטיס מודה מפורשות שספריית transformers של Hugging Face לא תומכת בטעינה ישירה של המשקלים כרגע, מה שמחייב שימוש בכלים ייעודיים בלבד ומסבך את הפריסה הראשונית. בנוסף, למרות ההבטחה ל־OCR משופר ב־32 שפות, אין בכרטיס פירוט של רשימת השפות המדויקת, כך שאין לדעת אם עברית נתמכת ברמה סבירה בלי לבדוק בפועל.

מגבלה נוספת נובעת מטיב הנתונים: הכרטיס אינו כולל ציוני בנצ'מרק מספריים מפורטים בטקסט אלא הפניות לתמונות, ולכן חובה לבדוק אישית את ביצועי ההסקה והדיוק של קוונטיזציית ה־FP8 במשימות המדויקות שלכם לפני שמחליטים להסתמך עליה.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר לטעון את המודל ישירות דרך transformers?

לא כרגע. התיעוד מציין שאין תמיכה ישירה בספרייה הזו כרגע, והם ממליצים להשתמש ב־vLLM או ב־SGLang כדי להריץ את המשקלים.

כמה זיכרון וידאו צריך בשביל להריץ אותו?

הקבצים לבדם שוקלים 221 ג'יגה בייט בפורמט FP8. כדי להחזיק אותם יחד עם הקשר של 256K טוקנים תצטרכו שרת עם לפחות 4 עד 8 כרטיסי מסך חזקים כמו H100 או A100 של 80GB.

האם יש ירידה באיכות בגלל הקוונטיזציה ל־FP8?

לפי התיעוד של Qwen, הקוונטיזציה נעשתה בשיטה עדינה עם בלוקים של 128, והמדדים שלה כמעט זהים לחלוטין לגרסת ה־BF16 המקורית.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־221 ג'יגה בייט בפורמט FP8 עם בלוקים של 128. בשביל להרים מפלצת כזו בשרת עצמאי תצטרכו מערך של כמה כרטיסי H100 או A100 עם זיכרון משותף גדול מאוד, אחרת אין איפה לשמור את המשקלים ומרחב ההקשר. transformers הרגילה לא תומכת כרגע בטעינה ישירה של המשקלים האלה לפי התיעוד, ולכן חובה להשתמש במנועים כמו vLLM או SGLang.

אם אין לכם אשכול מחשוב ייעודי שעולה אלפי דולרים בחודש, אין שום היגיון לנסות להריץ אותו לבד. עדיף בהרבה לפנות ל־API חיצוני שמארח את המודל ולשלם לפי טוקנים מאשר לתחזק שרתים כאלה בבית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-235B-A22B-Instruct-FP8")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש בלי תמלוגים. אתם יכולים לשלב אותו במוצר פנימי או מסחרי, בתנאי שאתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗