GPT
Q

Qwen2.5-VL-3B-Instruct

קוד פתוח

Qwenרישיון לא דווח2025-01-26

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

גרסת 3.8 מיליארד פרמטרים מיועדת לעיבוד תמונות ווידאו ישירות על חומרה מקומית. מקבלים יכולת זיהוי ויזואלי וניתוח מסמכים בלי תלות בשרתים מרוחקים.

  • 3.8Bפרמטרים
  • 128,000טוקנים בהקשר
  • 7.0 GBמשקל הקבצים
  • 3,173,588הורדות בחודש

מה זה

מדובר במודל רב מודאלי קומפקטי שמקבל טקסט יחד עם תמונות או סרטוני וידאו, ומחזיר טקסט. הארכיטקטורה משלבת מנגנון דגימת קצב פריימים דינמי וחלונות קשב ברכיב הראייה, מה שמאפשר לו להבין וידאו באורך של מעל שעה ולאתר בו אירועים לפי נקודות זמן.

הביצועים שלו מפתיעים ביחס לגודל. במבחן MathVista הוא מגיע לציון 62.3, ובמבחן DocVQA הוא משיג 93.9, שניהם עוקפים את התוצאות של גרסת ה־7B מהדור הקודם. לצד מסמכים, הוא תומך בהחזרת קואורדינטות של אובייקטים בתוך פלט JSON מובנה ובהפעלת ממשקי מערכת הפעלה.

מתאים ל

  • חילוץ מידע מחשבוניות

    התוצאה הגבוהה במבחני DocVQA ויכולת הפליטה בפורמט JSON מתאימות לקריאת טפסים סרוקים.

  • ניתוח ואיתור קטעים בווידאו

    התאמת זמנים דינמית מאפשרת לתחקר הקלטות ארוכות ולמצוא אירוע ספציפי על ציר הזמן.

  • שליטה בממשקי מסך

    זיהוי אלמנטים גרפיים והחזרת קואורדינטות מאפשרים הפעלה של סוכנים באפליקציות ובמובייל.

איפה זה נופל

למרות ההבטחה לחלון הקשר ענקי, ברירת המחדל בהגדרות הקובץ מוגבלת ל־32,768 טוקנים. הרחבה של החלון באמצעות מנגנון YaRN פוגעת ישירות ובאופן מוצהר ביכולת של המודל לדייק במיקום מרחבי בתמונות ובאיתור זמנים בווידאו.

מעבר לזה, המודל מוגדר רשמית לשפה האנגלית בלבד. במשימות של סוכנים אוטונומיים מורכבים כמו Android Control Low הביצועים צונחים לציון של 22.2, וב־ScreenSpot Pro הוא נעצר ב־23.9 בלבד.

אותה משפחה

Qwen2.5-VL יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לקריאת מסמכים בעברית?

המודל מתועד ומוגדר רשמית עבור אנגלית בלבד. הוא לא אומן ייעודית לעברית, ולכן לא מומלץ להסתמך עליו בעיבוד טפסים מקומיים בלי בדיקה מעמיקה של אחוזי הדיוק.

איך שומרים על זיכרון נמוך בזמן עיבוד תמונות כבדות?

המעבד של המודל מאפשר להגדיר ידנית ערכי min_pixels ו־max_pixels. הגבלת כמות הפיקסלים מקטינה ישירות את מספר הטוקנים שנוצרים וחוסכת שימוש בזיכרון המאיץ הגרפי.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.0 גיגה בייט בפורמט bfloat16. כדי להריץ אותו בהסקה בצורה חלקה תצטרכו כרטיס מסך עם לפחות 10 עד 12 גיגה בייט של זיכרון ייעודי, במיוחד אם אתם מעבדים סרטונים או תמונות ברזולוציה מלאה שמנפחות את כמות הטוקנים.

ספריית transformers דורשת התקנה ישירות ממאגר הגיטהאב כדי למנוע שגיאות זיהוי של הארכיטקטורה. בנוסף נדרשת חבילת עזר בשם qwen-vl-utils. אם אין לכם חומרה ייעודית זמינה ואתם צריכים עיבוד ספורדי בלבד, שירות ענן או API יהיה זול ופשוט יותר מלהחזיק שרת דולק.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2.5-VL-3B-Instruct")
print(pipe("שלום"))

הרישיון

במפרט הנתונים הרשמי של הדף לא צוין רישיון קונקרטי, אך כרטיס המודל מפנה לקובץ תחת השם qwen-research. המשמעות היא שאין אישור מפורש לשימוש מסחרי חופשי, וכל מי שמתכנן להטמיע אותו במוצר עסקי חייב לבדוק את תנאי הרישיון המדויקים במאגר לפני תחילת הפיתוח.

הרישיון המלא בעמוד המודל ↗