GPT
Q

Qwen2-VL-7B-Instruct

קוד פתוח

Qwenapache-2.02024-08-28

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

מודל פתוח שמעבד תמונות ברזולוציה מקורית וסרטונים ארוכים בלי לחתוך פיקסלים. הוא מציג יכולות קריאת מסמכים וטקסט שמתחרות ישירות במודלים מסחריים גדולים בהרבה.

  • 8.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 1,246,513הורדות בחודש

מה זה

המודל מטפל בקלט ויזואלי בצורה גמישה באמצעות מנגנון שממפה רזולוציות שונות ישירות למספר משתנה של טוקנים, בלי לכפות גודל אחיד שמורח את התמונה. הוא תומך בהבנת מסמכים, תרשימים, ממשקי משתמש וסרטונים שנמשכים מעל עשרים דקות, לצד פענוח טקסט בתמונות בשפות אירופיות, ערבית, יפנית ועוד.

במבחני ביצועים הוא עוקף מודלים בגודל דומה ומתקרב למודלים סגורים. במבחני הבנת מסמכים וטקסט בתמונה כמו DocVQA עם ציון 94.5 ו־TextVQA עם 84.3, הוא מציג דיוק גבוה במיוחד. המשמעות בפועל היא שהוא חזק מאוד בחילוץ נתונים מדפי חשבון, צילומי מסך וטבלאות סרוקות, תחום שבו מודלים קטנים נוטים להמציא פרטים.

מתאים ל

  • חילוץ מידע ממסמכים וקבלות

    קריאת טקסט וטבלאות ישירות מקבצי תמונה ללא צורך במנוע OCR חיצוני נפרד.

  • תחקור ותיוג קטעי וידאו

    ניתוח רצף אירועים וחיפוש תוכן ויזואלי בסרטונים ארוכים ללא עיבוד שמע.

  • אוטומציה של ממשקי משתמש

    פיענוח צילומי מסך במחשב או בטלפון הנייד ותרגומם לפעולות בממשק.

איפה זה נופל

אל תבנו עליו לספירת פריטים בתמונות מורכבות, הוא מתקשה לספק מספר מדויק כשמדובר בהרבה עצמים צפופים. בנוסף, ההבנה המרחבית שלו מוגבלת, במיוחד בכל מה שקשור למיקום יחסי של אובייקטים בתלת מימד, כך שהוא לא מתאים להנחיית רובוטיקה עדינה ללא בדיקות מחמירות.

בסרטונים הוא מתעלם לחלוטין מסאונד כי אין לו תמיכה בשמע, מה שפוסל אותו מניתוח שיחות וידאו או הרצאות בלי כתוביות מובנות. נתוני האימון שלו מעודכנים רק עד יוני 2023, והוא מתקשה לעקוב אחרי הוראות ארוכות שמכילות שלבים מרובים, ומפגין חולשה בזיהוי אישים מוכרים ומותגים מסחריים.

אותה משפחה

Qwen2-VL יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין דיבור או צלילים מתוך סרטוני וידאו?

לא. המודל מעבד רק את הפריימים הוויזואליים של הווידאו ומתעלם לחלוטין מערוץ השמע. אם הווידאו כולל דיבור, יש צורך לתמלל אותו מראש או להשתמש בכתוביות מובנות בגוף הסרט כדי שהתוכן יילקח בחשבון.

איך אפשר לשלוט בניצול הזיכרון בעת הזנת תמונות כבדות?

הקוד מאפשר להגדיר ידנית את טווח הפיקסלים המינימלי והמקסימלי למעבד התמונה. הגבלה למספר טוקנים נמוך חוסכת זיכרות ומאיצה את החישוב על חשבון חדות הפרטים הקטנים.

איך מריצים

המשקלים תופסים 15.5 גיגה בייט בדיוק bfloat16, כך שכדי להריץ אותו מקומית באופן יציב עם חלון הקשר סביר וקלט ויזואלי תצטרכו כרטיס מסך עם לפחות 24 גיגה בייט של זיכרון, כמו RTX 3090 או כרטיס שרת מקביל. הרצה דורשת התקנה של ספריית transformers ישירות ממאגר הקוד או גרסה עדכנית שתומכת בארכיטקטורה, יחד עם חבילת העזר הייעודית של הפרויקט לטיפול בקבצים.

אם אין לכם חומרה ייעודית זמינה ברציפות והשימוש שלכם כולל בעיקר שליחת שאילתות בודדות או עיבוד סרטונים כבדים מדי פעם, פנייה לפתרון ענן מנוהל תחסוך את עלויות התחזוקה וההקמה של השרת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2-VL-7B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש חופשי בקוד ובמשקלים, כולל הטמעה במוצרים מסחריים סגורים ושינוי של הקוד לפי הצורך. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים וצירוף עותק של הרישיון המקורי בעת הפצה מחדש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗