GPT
Q

Qwen2.5-VL-32B-Instruct

קוד פתוח

Qwenapache-2.02025-03-21

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

מודל ראייה ושפה במשקל בינוני שמסוגל לנתח וידאו ארוך ולחלץ מידע מתמונות. הוא נותן חלופה פתוחה וחזקה במיוחד בלי לקפוץ למפלצות של שבעים מיליארד פרמטרים.

  • 33Bפרמטרים
  • 128,000טוקנים בהקשר
  • 63.6 GBמשקל הקבצים
  • 1,362,412הורדות בחודש

מה זה

במשקל של שלושים ושלושה מיליארד פרמטרים, המודל הזה מתמקם בדיוק ברווח שבין מודלים קלים ומוגבלים לבין מודלי ענק יקרים להחריד. הוא מעבד תמונות, סרטוני וידאו של מעל שעה, ומסמכים מורכבים כמו טבלאות וחשבוניות, כולל פליטת נקודות ציון וקואורדינטות בפורמט מבני יציב.

במבחני ביצועים הוא עוקף את הדור הקודם של הסדרה כמעט בכל מדד, ולעיתים נוגע בביצועים של דגם ה־72B הקודם. במבחני הבנת מסמכים הוא מציג ציון של 94.8 ב־DocVQA, ובמבחן המתמטיקה החזותית MathVision הוא הגיע ל־40.0, תוצאה שאפילו עוקפת את גרסת ה־72B החדשה. במבחני טקסט טהור הוא מוציא 91.5 ב־Human Eval, מה שאומר שהוא שומר על יכולות קוד חזקות מאוד למרות הדגש החזותי.

מתאים ל

  • סריקה וניתוח של חשבוניות

    חילוץ נתונים מדויק מטבלאות וטפסים סרוקים ישירות למבנה נתונים מסודר, עם ציון של 94.8 במבחן DocVQA.

  • ניתוח ואיתור אירועים בווידאו

    סריקת סרטונים באורך של מעל שעה וזיהוי מדויק של חותמות זמן שבהן מתרחש אירוע מסוים.

  • זיהוי רכיבים בממשקי משתמש

    הפקת קואורדינטות ומיקומי כפתורים בצילומי מסך של טלפונים, עם תוצאה של מעל 93 אחוז ב־Android Control.

איפה זה נופל

למרות ההצהרה על תמיכה בהקשר ארוך, קובץ ההגדרות מגיע כברירת מחדל עם מגבלה של 32,768 טוקנים בלבד. הרחבה ל־128 אלף טוקנים בעזרת YaRN פוגעת ישירות ובאופן משמעותי בדיוק של זיהוי מיקומים בזמן ובמרחב, כך שהמפתחים עצמם ממליצים להימנע מזה במשימות איתור.

בנוסף, משימות מורכבות של הפעלת מערכת הפעלה נותרו נקודת תורפה ברורה, עם ציון נמוך של 5.92 בלבד במבחן OSWorld. בתחום הווידאו הוא מקבל כרגע קבצים מקומיים בלבד, וספריות פענוח הווידאו דורשות תלויות ספציפיות שלא תמיד עובדות מחוץ ללינוקס.

אותה משפחה

Qwen2.5-VL יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון כרטיס מסך צריך כדי להריץ אותו?

המודל שוקל כ־64 גיגה-בייט בפורמט bfloat16. להרצה מקורית תצטרכו לפחות 80 גיגה-בייט של זיכרון גרפי עבור המודל עצמו והקשר קצר, ועדיף צמד כרטיסים אם אתם מעבדים וידאו ארוך או תמונות ברזולוציה מלאה.

האם המודל מוגבל לטקסטים קצרים?

ברירת המחדל עומדת על 32K טוקנים. אפשר להרחיב את הטווח עם שינוי הגדרות ידני או שימוש ב־YaRN, אך המפתחים מזהירים שהרחבה כזו פוגעת ביכולת של המודל לאתר אובייקטים במרחב התמונה ובציר הזמן.

איך מריצים

כדי להעלות את משקלי ה־bfloat16 הגולמיים, ששוקלים קרוב ל־64 גיגה-בייט, תצטרכו שרת עם שני כרטיסי A100 או H100 של 80 גיגה-בייט, או להשתמש בכימות כדי לדחוס אותו לחומרה צנועה יותר. הקוד דורש התקנה ישירה ממאגר הפיתוח של transformers כדי לא להיתקל בשגיאות זיהוי ארכיטקטורה, ובנוסף תצטרכו את חבילת qwen-vl-utils לטיפול בקלט החזותי.

אם אין לכם קלאסטר זמין או צורך קשיח בפרטיות מידע מקומית, עדיף להשתמש בו דרך ספקי API. עלויות התחזוקה של מכונה ייעודית בגודל הזה יקרות בהרבה מרוב תרחישי השימוש השוטפים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2.5-VL-32B-Instruct")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין. מותר לכם לשנות את הקוד, לשלב אותו במוצרים מסחריים ולהפיץ אותו, כל עוד אתם שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗