GPT
Q

Qwen3-VL-2B-Instruct-FP8

קוד פתוח

Qwenapache-2.02025-10-19

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל ראייה ושפה קל משקל שמגיע כבר בכימות של 8 ביט ורץ מקומית בלי לבלוע משאבים. הוא מיועד למי שרוצה פענוח מסמכים או סרטונים ארוכים על חומרה צנועה.

  • 2.4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 3.2 GBמשקל הקבצים
  • 105,329הורדות בחודש

מה זה

מדובר בגרסת FP8 מכוילת של מודל הראייה מסדרת Qwen3, עם 2.4 מיליארד פרמטרים ששוקלים יחד 3.2 גיגה בייט בלבד. למרות הגודל הזעיר שלו, הוא כולל חלון הקשר של 262,144 טוקנים, מה שמאפשר לו לקלוט ספרים שלמים או שעות של וידאו עם מעקב זמנים ברמת השנייה. הוא משלב ארכיטקטורה שמעבדת זמן ומרחב לצד חיבור ישיר של שכבות ראייה עמוקות לטקסט.

הוא מסוגל לפענח תמונות, לזהות רכיבי ממשק במחשב ובנייד כדי לפעול כסוכן, לחלץ קוד מתוך תרשימים, ולהריץ OCR ב־32 שפות כולל טקסטים מטושטשים או נטויים. הדחיסה לבלוקים של 128 ב־FP8 שומרת, לפי המפתחים, על ביצועים כמעט זהים לחלוטין לגרסת המקור הלא מכווצת.

מתאים ל

  • חילוץ טקסט מתמונות ומסמכים

    מנוע הראייה תומך ב־32 שפות ומזהה טקסט גם בתנאי תאורה קשים, זווית עקומה או טשטוש.

  • אוטומציה של ממשקי משתמש

    הוא מזהה אלמנטים גרפיים על מסכי מחשב וטלפון, מבין את הפעולה שלהם ומפעיל כלים בהתאם.

  • המרת תרשימים לקוד

    הוא מסוגל לקרוא דיאגרמות או עיצובים ויזואליים ולפלוט מהם קוד HTML, CSS, JS או Draw.io.

איפה זה נופל

בסוף מדובר במודל של 2.4 מיליארד פרמטרים בלבד, ויש גבול ברור לעומק ההיגיון והחשיבה המתמטית שהוא יכול לספק מול דגמי ענק. מעבר לזה, הכרטיס מודה מפורשות שספריית transformers הבסיסית עדיין לא תומכת בטעינה ישירה של הקבצים האלה, מה שעלול לשבור סקריפטים מוכנים ולדרוש התאמות תשתית לפני שבכלל מתחילים לעבוד.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ אותו ישר עם huggingface transformers?

לא. נכון לפרסום הדף הזה, transformers עדיין לא תומכת ישירות במשקלים האלה. תצטרכו להשתמש בסביבות כמו vLLM או SGLang כדי לטעון אותו.

האם הכימות ל־FP8 פגע ביכולות הראייה והטקסט?

לפי נתוני הפיתוח, הכימות נעשה בבלוקים של 128 והביצועים כמעט זהים לחלוטין לגרסת ה־BF16 המקורית, תוך חיסכון משמעותי במקום.

איך מריצים

נכון לעכשיו אי אפשר לטעון את המשקלים ישירות דרך ספריית transformers הרגילה, למרות התיוג שלה. כדי להריץ אותו בפועל צריך להשתמש במנועים ייעודיים כמו vLLM או SGLang, ולדאוג למעבד גרפי עם תמיכה בחומרת FP8 כדי לקבל את הביצועים המובטחים.

הגודל הקומפקטי אומר שכרטיס מסך בודד עם 6 עד 8 גיגה זיכרון יספיק בקלות להרצה ביתית של המודל. עם זאת, אם אתם צריכים רק שאילתות בודדות של זיהוי תמונה פעם בכמה שעות, הרמת תשתית כזו עצמאית תהיה מיותרת ועדיף להסתמך על שירות מנוהל חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-2B-Instruct-FP8")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצר, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗