GPT
Q

Qwen2.5-VL-7B-Instruct

קוד פתוח

Qwenapache-2.02025-01-26

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

מודל ראייה ושפה קומפקטי שמצטיין בניתוח מסמכים, איתור עצמים בתמונה והבנת וידאו ארוך. הוא מציע יכולות של מודלים ענקיים בגודל שרץ על חומרה מקומית סבירה.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 7,747,615הורדות בחודש

מה זה

מדובר במודל רב מודלי של 8.3 מיליארד פרמטרים שקולט תמונות, וידאו וטקסט ומחזיר טקסט. הוא יודע לקרוא טקסט מורכב מתמונות, לפרק מסמכים סרוקים למבנה נתונים כמו ג'ייסון, ולזהות מיקום מדויק של עצמים באמצעות קואורדינטות. בנוסף, הוא מעבד סרטונים של מעל שעה ויודע להצביע על נקודת הזמן שבה קרה אירוע מסוים.

במבחני ביצועים של קריאת מסמכים ותרשימים, כמו DocVQA שבו קיבל 95.7 ו־ChartQA עם 87.3, הוא עוקף את הדור הקודם שלו ומתחרה ראש בראש במודלים סגורים כמו GPT-4o-mini. השיפור המשמעותי ביותר מורגש ביכולת לחלץ נתונים מספריים מגרפים ובפתרון בעיות מתמטיות ויזואליות, תחומים שבהם מודלים פתוחים קטנים התקשו עד כה.

מתאים ל

  • פיענוח חשבוניות וטפסים

    הוא מנתח צילומי מסמכים ומחזיר את הערכים ישירות במבנה ג'ייסון לפי שדות מוגדרים.

  • איתור אירועים בווידאו

    הוא סורק קובץ וידאו ארוך ומצביע על הדקה והשנייה שבהן מתרחשת פעולה מבוקשת.

  • זיהוי ומיקום עצמים

    הוא מחזיר תיבות תוחמות ונקודות ציון מדויקות של אלמנטים על גבי תמונה או צילום מסך.

איפה זה נופל

למרות ההצהרה על חלון הקשר של 128 אלף טוקנים, ההגדרה הבסיסית בקובץ הקונפיגורציה נעצרת ב־32 אלף. הרחבה מעבר לכך באמצעות מנגנון YaRN פוגעת ישירות ובאופן מורגש בדיוק של איתור מיקומים בתמונה וזיהוי זמנים בווידאו, והמפתחים עצמם לא ממליצים להשתמש בה למשימות כאלה. מעבר לכך, במבחני אוטונומיה ושליטה בממשקים כמו ScreenSpot Pro או בדיקות שליטה במכשירי אנדרואיד, הביצועים שלו צונחים לאזור ה־25 עד 29 אחוזים, כך שלא הייתי סומך עליו כסוכן עצמאי שלוחץ על מסכים.

אותה משפחה

Qwen2.5-VL יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לניתוח וידאו מקישורי רשת ישירים?

עבור וידאו יש תמיכה בקבצים מקומיים בלבד, בניגוד לתמונות שניתן להזין גם דרך כתובת אינטרנט או בקידוד בייס 64. בנוסף, עיבוד וידאו מלא דורש התקנה של ספריות מערכת ייעודיות לטעינת פריימים, שתלויות במערכת ההפעלה.

איך שולטים על ניצול הזיכרון כשטוענים תמונות כבדות?

המעבד של המודל מאפשר להגדיר ידנית את טווח הפיקסלים המינימלי והמקסימלי, או לכפות ממדי גובה ורוחב שמתחלקים ב־28. הגבלת כמות הטוקנים שהתמונה מייצרת חוסכת זיכרון תצוגה ומאיצה את הריצה.

איך מריצים

כדי להריץ אותו במשקל המקורי של 16 ביט דרושים 15.5 גיגה בייט של זיכרון תצוגה רק למשקלים, כך שכרטיס עם 24 גיגה בייט זיכרון הוא המינימום המעשי לריצה עם הקשר קצר. המודל דורש התקנה ישירה של ספריית transformers מהקוד הראשי בגיטהאב כדי למנוע שגיאות טעינה, יחד עם חבילת עזר ייעודית לטיפול בווידאו ובתמונות.

אם אתם מתכננים להזין סרטונים ארוכים או תמונות ברזולוציה מלאה, צריכת הזיכרון תזנק במהירות ותחייב חלוקה בין כרטיסים. בתרחיש כזה, או אם אין לכם שרת ייעודי זמין ברציפות, קריאה לנקודת קצה מנוהלת תחסוך את ההתעסקות בהגדרות הזיכרון של רכיבי הווידאו.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2.5-VL-7B-Instruct")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון אפאצ'י 2.0 המלא. אפשר להשתמש בו ליישומים מסחריים, לשנות אותו, להריץ אותו בענן פרטי או להפיץ אותו בתוך מוצר סגור, בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗