GPT
Q

Qwen2.5-VL-7B-Instruct-AWQ

קוד פתוח

Qwenapache-2.02025-02-15

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת בשיטת AWQ למודל הראייה והטקסט הפופולרי, שתופסת 6.5 גיגה בייט בלבד. היא מיועדת למי שרוצה ניתוח מסמכים, תמונות ווידאו ארוך על כרטיס מסך בודד בלי לשחוט את הזיכרון.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 6.5 GBמשקל הקבצים
  • 1,910,757הורדות בחודש

מה זה

מדובר במודל ראייה שמשלב עיבוד של תמונות, וידאו וטקסט בתוך ארכיטקטורה של 8.3 מיליארד פרמטרים. השוני העיקרי כאן לעומת מודלים רגילים באותו סדר גודל הוא היכולת לפרק וידאו של יותר משעה ולאתר בו אירועים ספציפיים על ציר הזמן, לצד הפקת נקודות ציון ותיבות תוחמות בתמונות. המודל מחזיר פלט מובנה כמו JSON עבור קבלות, טבלאות וטפסים, ומתאים לשמש כסוכן ויזואלי שמסוגל להפעיל ממשקים במחשב או בטלפון.

מבחני הביצועים מראים שהקוונטיזציה כמעט לא פגעה ביכולת ניתוח המסמכים. בבדיקת DocVQA המודל שומר על דיוק של 94.6 אחוז לעומת 94.9 בגרסת הדיוק המלאה, ובמבחן MMBench הציון עומד על 84.2 אחוז. הירידה מורגשת יותר במשימות היגיון ומתמטיקה ויזואלית, שם הציון ב־MathVista יורד מ־67.9 ל־64.7, וב־MMMU יש ירידה מכמעט 58.5 ל־55.6 אחוז.

מתאים ל

  • חילוץ מידע ממסמכים וקבלות

    שומר על דיוק של 94.6 אחוז במבחני מסמכים ומייצר פלט JSON ישיר מטבלאות וטפסים סרוקים.

  • איתור קטעים בווידאו ארוך

    מסוגל לקלוט וידאו של יותר משעה ולהצביע על חותמות זמן מדויקות שבהן התרחש אירוע מוגדר.

  • הפעלת ממשקי משתמש ומסכים

    מזהה כפתורים ואייקונים ומחזיר קואורדינטות ותיבות תוחמות לצורך אוטומציה של פעולות במחשב.

איפה זה נופל

ברירת המחדל בקובץ ההגדרות נעצרת ב־32,768 טוקנים. כדי להגיע לחלון המלא צריך להפעיל מנגנון YaRN, אבל המפתחים מציינים במפורש שהוא פוגע באופן משמעותי בדיוק של מיקום מרחבי וזיהוי זמנים בווידאו, ולכן הם לא ממליצים עליו למשימות כאלה.

בנוסף, עיבוד וידאו עובד נכון לעכשיו רק עם קבצים מקומיים ולא תומך בקישורים חיצוניים, והשפה היחידה שמוגדרת במודל היא אנגלית. כל ניסיון לחלץ נתונים בעברית מתמונות או לנהל שיחה מקומית עלול להניב שגיאות או תוצאות שבורות לחלוטין.

אותה משפחה

Qwen2.5-VL יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך שולטים בצריכת הזיכרון כשמעלים תמונות גדולות?

המודל מנתח תמונות ברזולוציה המקורית שלהן, מה שעלול לנפח את כמות הטוקנים. בשימוש בקוד אפשר להגדיר מראש את כמות הפיקסלים המינימלית והמקסימלית במעבד, או לכפות ממדים קבועים בקפיצות של 28 פיקסלים כדי לא לחרוג מזיכרון הכרטיס.

כמה ביצועים מאבדים בגרסה הזו לעומת הגרסה הרגילה?

בניתוח מסמכים וטקסט בתמונות ההבדל זניח לחלוטין ועומד על שברירי אחוזים. הפגיעה מתבטאת בעיקר בשאלות היגיון רב-תחומיות ומתמטיקה ויזואלית, שם יש ירידה של כשלושה אחוזים בדיוק.

איך מריצים

המשקל הכולל ירד ל־6.5 גיגה בייט, מה שאומר שכרטיס מסך ביתי מודרני עם 12 או 16 גיגה בייט של זיכרון יריץ אותו בלי להזיע, יחד עם התמונות והטוקנים של הפלט. כדי לטעון אותו צריך להתקין את transformers ישירות מגיטהאב כדי לא לחטוף שגיאות של חוסר זיהוי ארכיטקטורה, ולעבוד עם ספריית העזר ייעודית של הפרויקט לטיפול בקובצי תמונה ווידאו.

אם אתם רצים על לינוקס תצטרכו את חבילת decord לטעינת וידאו מהירה, ובמערכות אחרות תהיה נסיגה ל־torchvision אלא אם תקמפלו ידנית. הרצה עצמית שווה את המאמץ אם אתם מעבדים מסמכים רגישים מקומית או מריצים סוכן שצריך גישה ישירה למסך, אבל בשביל עיבוד מזדמן של תמונות בודדות API מרוחק עדיין יחסוך את כאב הראש של ניהול התלויות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2.5-VL-7B-Instruct-AWQ")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, לשלב אותו במוצרים סגורים ולהפיץ אותם, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗