GPT
Q

Qwen3-VL-32B-Instruct-FP8

קוד פתוח

Qwenapache-2.02025-10-19

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת בפורמט FP8 למודל ראייה ושפה של 33 מיליארד פרמטרים. היא נותנת ביצועים כמעט זהים למקור אבל חוסכת חצי מעלויות הזיכרון בריצה מקומית.

  • 33Bפרמטרים
  • 262,144טוקנים בהקשר
  • 33.1 GBמשקל הקבצים
  • 524,017הורדות בחודש

מה זה

המודל הזה משלב ניתוח תמונה, וידאו וטקסט בתוך חלון הקשר עצום של 262,144 טוקנים. הוא מחזיק בתוכו שיפורים משמעותיים בארכיטקטורה כמו הצמדת חותמות זמן לטקסט ושימוש בשכבות מרובות של מקודד התמונה כדי לא לאבד פרטים קטנים. החידוש המרכזי כאן הוא הכיווץ, דחסו את המודל לבלוקים של 128 בשיטת FP8, כך שכל המשקלים יושבים בתוך 33.1 ג'יגה בייט במקום יותר משישים ג'יגה בייט בפורמט BF16 הרגיל.

ביכולות הראייה הוא מסוגל לאתר אובייקטים במרחב דו ממדי ותלת ממדי, לפרק ממשקי משתמש של מחשב ונייד לפעולות, ולקרוא מסמכים סרוקים ב־32 שפות שונות גם כשיש טשטוש או זווית עקומה. בנוסף הוא מייצר קוד תצוגה ישירות מתמונות ומתמודד עם וידאו ארוך מאוד בלי לאבד את ההקשר בין האירועים.

מתאים ל

  • אוטומציה לממשקי משתמש

    זיהוי אלמנטים על המסך בלחיצות וכפתורים כדי להפעיל תוכנות ומערכות הפעלה ישירות מתוך תמונות מסך.

  • תמלול מסמכים וסריקות

    חילוץ מידע מדויק מדוחות סרוקים, תרשימים וטבלאות גם בתנאי צילום קשים, חושך או טקסט נטוי.

  • המרת עיצוב לקוד

    ייצור קוד HTML, CSS ותרשימי Draw.io ישירות מסקיצות ומצילומי מסך של עיצובים קיימים.

איפה זה נופל

החיסרון המיידי הוא התאימות. אי אפשר פשוט לטעון אותו עם ספריית transformers הסטנדרטית, מה שמסבך את הפיתוח המקומי ומחייב סביבת עבודה עם מנועי שרת ייעודיים. בנוסף, למרות ההבטחה לביצועים כמעט זהים למקור, קוונטיזציה של שמונה ביט עדיין יכולה לייצר חוסר דיוק במשימות קצה עדינות כמו פענוח כתב יד נדיר או זיהוי קואורדינטות זעירות בממשק משתמש.

הכרטיס מדבר על תמיכה ב־32 שפות לזיהוי טקסט אבל לא מפרט אילו שפות בדיוק נתמכות, כך שחובה לבדוק את איכות הקריאה בעברית לפני שמסתמכים עליו במוצר.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על כרטיס ביתי פשוט של 16 או 24 ג'יגה בייט?

לא. המשקלים לבדם שוקלים מעל 33 ג'יגה בייט, ובשביל להריץ אותם יחד עם זיכרון העבודה של הקלט והפלט צריך לפחות 40 עד 48 ג'יגה בייט של זיכרון גרפי. כרטיס ביתי פשוט ייחנק מחוסר זיכרון מיד עם הטעינה.

האם יש הבדל משמעותי באיכות בין גרסת FP8 הזו לגרסת המקור?

ברוב המשימות היומיומיות של ראייה וטקסט לא תרגישו בהבדל, והתוצאות כמעט זהות לחלוטין. במקרים מאוד ספציפיים שדורשים דיוק קיצוני במיקום אלמנטים או בחישובים מתמטיים מורכבים עדיף לבדוק אם הכיווץ לא יצר סטיות קלות לעומת המודל המלא.

איך מריצים

כדי להריץ 33 מיליארד פרמטרים ב־FP8 תצטרכו כרטיס מסך מודרני שתומך בחישובי נקודה צפה שמונה ביט ברמת החומרה, עם לפחות 40 עד 48 ג'יגה בייט של זיכרון גרפי אם רוצים לנצל הקשר ארוך. כרטיס בודד של 24 ג'יגה בייט לא יספיק לכם כאן בכלל בלי לחתוך משמעותית את אורך הקלט והזיכרון של התהליך.

הכרטיס מבהיר שספריית transformers הרגילה לא תומכת בטעינה ישירה של המשקלים האלה כרגע. במקום זה צריך לפרוס אותו דרך מנועי הסקה ייעודיים כמו vLLM או SGLang. אם אין לכם שרת ייעודי כזה פנוי בענן או במשרד, הקמה ותחזוקה של החומרה הזו תעלה לכם יותר מאשר פנייה ישירה ל־API חיצוני שמריץ את המודל.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-32B-Instruct-FP8")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים משוחררים תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש בתוך מוצרים פרטיים או פתוחים, בלי דרישה לחשוף את הקוד שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והצהרת הוויתור על אחריות של המפתחים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗