GPT
Q

Qwen2.5-VL-72B-Instruct

קוד פתוח

Qwenother2025-01-27

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

מודל ראייה ושפה ענק שמנתח סרטונים של יותר משעה, מחלץ נתונים מטבלאות ומשמש כסוכן ויזואלי להפעלת ממשקי מחשב וטלפון ברמת דיוק שמדביקה מערכות סגורות.

  • 73Bפרמטרים
  • 128,000טוקנים בהקשר
  • 137 GBמשקל הקבצים
  • 168,451הורדות בחודש

מה זה

זה מודל משולב תמונה וטקסט עם 73 מיליארד פרמטרים, שמיועד לקריאה של מסמכים מורכבים, ניתוח גרפים ואיכון פיקסלים לפי נקודות ותיבות תוחמות. הוא מקבל קלט ויזואלי ברזולוציה גמישה ודוגם קווי וידאו בקצבי פריימים משתנים, מה שמאפשר לו לזהות רגעים ספציפיים על ציר הזמן ולא רק לתאר מה רואים בכלליות.

במדדים של חילוץ טקסט מתמונות כמו OCRBench V2 הוא מקבל 61.5 באנגלית ו־63.7 בסינית, תוצאות שמשאירות מאחור מודלים מובילים של גוגל וקלאוד. במבחן MathVision הוא עומד על 38.1 נקודות, כמעט זהה לקלוד 3.5 סונט, מה שמראה יכולת הסקה טכנית מורכבת מתוך תרשימים ומשוואות.

מתאים ל

  • חילוץ מסמכים פיננסיים

    ממיר חשבוניות וטפסים סרוקים ישירות למבנה JSON מדויק בלי ליפול בטבלאות צפופות.

  • תחקור קובצי וידאו ארוכים

    סורק סרטונים של מעל שעה ומסמן במדויק את המקטע שבו קרה אירוע מסוים על ציר הזמן.

  • אוטומציה של אפליקציות מובייל

    מזהה רכיבי ממשק ומחזיר קואורדינטות של כפתורים לפי נקודות כדי להפעיל סוכני שימוש בטלפון.

איפה זה נופל

המודל מגיע עם הגדרה ברירת מחדל של 32,768 טוקנים בקובץ הקונפיגורציה, והרחבה לחלון המלא בעזרת YaRN פוגעת ישירות ובאופן מוצהר בדיוק המיקום המרחבי והזמני. בנוסף, במשימות ניווט מערכת הפעלה מורכבות כמו OSWorld הוא מוציא ציון של 8.83 בלבד, נמוך בהרבה מפתרונות מסחריים אחרים. בעבודה עם וידאו יש גם תלות מעצבנת בהתקנה ידנית של decord מקוד מקור בסביבות שאינן לינוקס, ואם משתמשים בווידאו ברשת, קישורי HTTPS נתמכים רק בספריית torchvision מגרסה 0.19 ומעלה.

אותה משפחה

Qwen2.5-VL יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות מתוך ספריית transformers הרגילה?

לא בגרסה הוותיקה. צריך להתקין את transformers ישירות ממאגר הגיטהאב יחד עם ספריית accelerate, אחרת מקבלים שגיאת KeyError על סוג המודל.

האם המודל מקבל קובצי וידאו דרך כתובת URL ברשת?

לא. לפי התיעוד קובצי וידאו נתמכים רק דרך נתיב לקובץ מקומי במערכת הקבצים של השרת, בניגוד לתמונות שכן אפשר להעביר כלינק או כבסיס 64.

איך מריצים

המשקולות לבד שוקלות 137 גיגה בייט בפורמט bfloat16 הפרוס על פני חמישים קבצים. כדי להרים אותו מקומית צריך מערך של לפחות שני כרטיסי A100 או H100 של 80 גיגה בייט, וגם אז כדאי להגביל את כמות הפיקסלים לטווח של 256 עד 1280 טוקנים כדי שהזיכרון לא ייחנק.

אם אין לכם קלאסטר ייעודי בענן שעולה אלפי דולרים בחודש, עדיף להריץ את הגרסאות הקטנות יותר של 7 או 3 מיליארד פרמטרים, או פשוט לצרוך את ה־72B דרך API חיצוני. הרצה עצמית בבית על כרטיס בודד לא באה בחשבון.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2.5-VL-72B-Instruct")
print(pipe("שלום"))

הקבצים

50 קבצים במאגר, 137 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כמותאם אישית תחת השם qwen ומפנה להסכם נפרד במאגר. הוא לא רישיון קוד פתוח סטנדרטי כמו Apache או MIT, ולכן אי אפשר להניח שמותר לשלב אותו בחופשיות במוצר מסחרי בלי לקרוא היטב את תנאי השימוש שהוצמדו לקבצים.

הרישיון המלא בעמוד המודל ↗