GPT
Q

Qwen2-VL-2B-Instruct

קוד פתוח

Qwenapache-2.02024-08-28

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

מודל ראייה קומפקטי שמביא יכולות פענוח תמונה ווידאו מרשימות לגודל של שני מיליארד פרמטרים בלבד. הוא מתאים למי שחייב להריץ משימות מולטימודל על חומרה מקומית צנועה.

  • 2.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 4.1 GBמשקל הקבצים
  • 2,037,704הורדות בחודש

מה זה

מדובר במודל ראייה שפה קטן מסדרת Qwen2 ששוקל 4.1 גיגה בייט בלבד בדיוק bfloat16. הוא יודע לקרוא טקסט מתוך תמונות, לנתח מסמכים מורכבים, ולעבד קטעי וידאו באורך של מעל עשרים דקות. החידוש המרכזי בארכיטקטורה שלו הוא תמיכה ברזולוציה דינמית מקורית ללא צורך בחיתוך או עיוות של התמונה, יחד עם שיטת מיקום תלת ממדית בשם M-ROPE שמתמודדת עם טקסט, מרחב וזמן.

במבחני ביצועים מול דגמים מקבילים בגודל שני מיליארד פרמטרים, הוא מציג יתרון ברור בקריאת מסמכים. במבחן DocVQA הוא הגיע לציון 90.1 לעומת 86.9 של המתחרה, ובמבחן OCRBench עקף עם 794 נקודות. המשמעות בשטח היא יכולת עבודה טובה מאוד עם צילומי מסמכים ותרשימים, אם כי במשימות מתמטיקה חזותית מורכבות כמו MathVision הוא עדיין נעצר על 12.4 נקודות בלבד.

מתאים ל

  • חילוץ נתונים ממסמכים וקבלות

    התוצאות שלו במבחני OCR וטפסים הופכות אותו לכלי מעולה לפענוח צילומי חשבוניות על חומרה מקומית.

  • תיוג וחיפוש בתוך סרטוני וידאו

    יכולת הטיפול בקטעי וידאו של עשרים דקות ומעלה מאפשרת לנתח תוכן חזותי רציף בלי להוציא הון על תשתיות.

  • הפעלה באוטומציה של מכשירים

    מבנה המודל תוכנן לעבודה על מכשירים ניידים ולהבנת מסכים בזמן אמת לשם ביצוע פעולות.

איפה זה נופל

הכרטיס מפרט במפורש שהמודל לא תומך בסאונד ומנתח וידאו ברמה החזותית בלבד. מסד הנתונים שלו מעודכן עד יוני 2023, והוא מתקשה בזיהוי דמויות ספציפיות, מותגים וקניין רוחני. בנוסף, הוא סובל מאי דיוק בספירת עצמים בסצנות צפופות, מתקשה בהבנת מרחב תלת ממדי, ומאבד את הידיים בהוראות מורכבות עם כמה שלבים. עברית גם לא מצוינת בין השפות הנתמכות בטקסט חזותי.

אותה משפחה

Qwen2-VL יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יצליח לקרוא עברית מתמונות?

הכרטיס מציין במפורש תמיכה בשפות אירופיות, יפנית, קוריאנית, ערבית וויאטנמית, אך עברית אינה מופיעה ברשימה. במשימות OCR של טקסט עברי הוא עלול לייצר שגיאות קשות ולכן מומלץ לבדוק אותו היטב לפני שימוש.

למה שהתמונות יאטו את קצב העבודה שלו?

המודל ממיר פיקסלים לטוקנים באופן דינמי לפי גודל הקובץ. תמונה גדולה מדי מייצרת כמות ענקית של טוקנים חזותיים שתעמיס על הזיכרון, ולכן כדאי להגדיר מראש בפרמטרים את טווח הפיקסלים המינימלי והמקסימלי.

האם הוא מסוגל לתמלל שיחה מתוך קובץ וידאו?

לא, הוא עיוור לחלוטין לציר השמע. המודל מתעלם מרצועת האודיו בקובץ ומנתח רק את הפריימים החזותיים, כך שאם יש צורך בתמלול תצטרכו להשתמש במודל שמע נפרד.

איך מריצים

בזכות משקל של כארבעה גיגה בייט, המודל הזה רץ בקלות על מעבד גרפי צרכני פשוט עם שישה עד שמונה גיגה בייט זיכרון. כדי להריץ אותו צריך להתקין את ספריית transformers ישר ממאגר הגיטהאב יחד עם חבילת העזר הייעודית qwen-vl-utils. סרטוני וידאו נתמכים כרגע רק כקבצים מקומיים, בעוד תמונות אפשר להעביר גם כקישור או מחרוזת base64.

הגודל הזה אידיאלי לקצה ולמכשירים מקומיים. עם זאת, אם אתם צריכים לנתח שאלות מורכבות בעברית או לבצע היגיון רב שלבי על בסיס התמונה, עדיף לפנות לגרסאות הגדולות יותר של 7B או 72B דרך ספקי ענן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2-VL-2B-Instruct")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0 הפתוח. המשמעות היא חופש מלא להשתמש בו לצרכים מסחריים, לשנות את המשקלים, להפיץ אותו מחדש או לשלב אותו במוצר פנימי, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗