GPT
Q

Qwen3-VL-4B-Instruct-FP8

קוד פתוח

Qwenapache-2.02025-10-11

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת FP8 מכווצת של מודל ראייה ושפה ששוקלת 5.6 גיגה בלבד. הוא מתאים למי שרוצה להריץ סוכן ויזואלי ועיבוד וידאו מקומי על חומרה צנועה.

  • 4.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 5.6 GBמשקל הקבצים
  • 322,292הורדות בחודש

מה זה

מדובר במודל מולטימודלי עם קרוב לחמישה מיליארד פרמטרים, שעבר קוונטיזציה של FP8 ברמת בלוקים כדי לשמור על דיוק קרוב למקור תוך חיסכון משמעותי בזיכרון. הוא מטפל בטקסט, בתמונות ובסרטונים ארוכים, ומביא חלון הקשר עצום של 256 אלף טוקנים שמאפשר לנתח מסמכים שלמים ושעות של וידאו.

הייחוד שלו בקטגוריית הגודל הזו הוא היכולת לפעול כסוכן ויזואלי שמזהה כפתורים וממשקים במחשב או בטלפון, לצד תמיכה בחישובי מיקום מרחביים בדו מימד ותלת מימד. בנוסף, מנגנון הראייה שלו מחבר שכבות שונות של הקידוד הגרפי כדי לתפוס פרטים קטנים, ומערכת המיקום הזמנית מאפשרת לו לאתר רגעים מדויקים בווידאו לפי חותמות זמן.

מתאים ל

  • אוטומציה של ממשקים

    זיהוי אלמנטים גרפיים במסכי מחשב ונייד והפעלת ממשק משתמש כסוכן עצמאי.

  • תחקור סרטונים ארוכים

    הקשר של 256 אלף טוקנים מאפשר לחפש אירועים מדויקים בווידאו לפי זמנים.

  • חילוץ קוד מעיצובים

    המרת צילומי מסך ושרטוטים לקוד פרונטנד מוכן בפורמט HTML, CSS או Draw.io.

איפה זה נופל

למרות השדרוג ביכולות הראייה, מנוע הטרנספורמרס הרגיל עדיין לא יודע לטעון את המשקלים האלה ישירות, מה שמסבך את הפיתוח המקומי ומחייב תלויות נוספות. מעבר לכך, התמיכה בזיהוי טקסט הוגדלה ל־32 שפות בלבד, כך שסביר להניח שעברית מורכבת בתמונות, שלטים מטושטשים או כתב יד עדיין יאתגרו אותו מאוד. כשמדובר במודל של פחות מחמישה מיליארד פרמטרים, הוא תמיד יתקשה בהסקה לוגית מורכבת בהשוואה לדגמים הגדולים.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל דרך קוד transformers פשוט?

לא כרגע. המפרסמים ציינו מפורשות שהספרייה לא תומכת בטעינה ישירה של המשקלים האלה, ויש להריץ אותו דרך מנועים כמו vLLM או SGLang.

כמה זיכרון וידאו צריך בפועל בשביל להריץ אותו?

המשקלים עצמם שוקלים 5.6 גיגה בייט. כרטיס מסך עם 12 עד 16 גיגה יספיק לחלוטין לטעינת המודל ולהקשר עבודה סביר.

האם הקוונטיזציה הזו פוגעת באיכות התוצאות ביחס למקור?

המפרסמים מדווחים שהביצועים בפורמט FP8 כמעט זהים למודל המקורי ב־BF16, הודות לחלוקה לבלוקים קטנים של 128 בזמן הכיווץ.

איך מריצים

אי אפשר לטעון את המשקלים האלה ישירות דרך ספריית transformers הרגילה, ולכן חייבים להשתמש במנועי הסקה מודרניים כמו vLLM או SGLang שתומכים בקוונטיזציה הזו. בגלל שמדובר בפורמט FP8, צריך כרטיס מסך שתומך בחישובים האלה ברמת החומרה, בדרך כלל מסדרות Ada Lovelace או Hopper ומעלה כדי לראות מהירות אמיתית.

כל הקבצים תופסים 5.6 גיגה, כך שכרטיס מסך בודד של 12 או 16 גיגה יחזיק אותו בקלות עם מקום פנוי להקשר רחב. אם אין לכם חומרה ייעודית עם תמיכה מתאימה בפורמט הזה, הפעלת מנוע מקומי תהיה איטית ומסורבלת, ובמצב כזה עדיף לצרוך אותו דרך שרת מרוחק.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-4B-Instruct-FP8")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache 2.0 המוכר. זה אומר שמותר להשתמש בו בחופשיות לפרויקטים מסחריים ופרטיים, לשנות את הקוד ולהפיץ אותו במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗