GPT
Q

Qwen2-VL-72B-Instruct

קוד פתוח

Qwenother2024-09-17

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

מודל ויזואלי ענק של 73 מיליארד פרמטרים שמנתח תמונות ברזולוציה משתנה וסרטונים ארוכים. הוא מיועד למי שחייב ביצועי ראייה ברמת סגורות אבל צריך משקולות עצמאיות.

  • 73Bפרמטרים
  • 32,768טוקנים בהקשר
  • 137 GBמשקל הקבצים
  • 33,726הורדות בחודש

מה זה

המודל מעבד תמונות בלי לחתוך אותן לגודל קבוע מראש, אלא מייצר כמות טוקנים דינמית בהתאם לרזולוציה המקורית. השיטה הזו, יחד עם קידוד מיקום שמתחשב בממד הזמן, מאפשרת לו לקרוא מסמכים צפופים ולנתח קטעי וידאו של מעל 20 דקות מקובץ מקומי.

במדדי פענוח מסמכים כמו DocVQA הוא קיבל 96.5 לעומת 92.8 של GPT-4o, ובבדיקות OCRBench הגיע ל־877 לעומת 736 של המתחרה מסחרי. המשמעות בפועל היא יכולת חילוץ טקסט חריגה מתוך צילומי מסך ותרשימים, לצד שליטה בהפעלת ממשקי אנדרואיד על בסיס תמונה עם 89.6 אחוזי התאמת סוג.

מתאים ל

  • חילוץ מידע ממסמכים וטפסים

    ניתוח דוחות סרוקים ותרשימים מורכבים בזכות ציון 96.5 במבחן DocVQA ויכולות OCR גבוהות במיוחד.

  • תחקור וסריקת קטעי וידאו

    מענה על שאלות מתוך סרטונים מקומיים של מעל 20 דקות על ידי עיבוד רצף הפריימים בחלון גדול.

  • סוכן תפעול ממשקי משתמש

    קריאת מסכי טלפון וקבלת החלטות לחיצה עם 72.1 אחוזי דיוק מלא במדד המכשירים AITZ.

איפה זה נופל

הכרטיס מציין במפורש שהמודל לא תומך בסאונד, כך שניתוח וידאו מתבסס על הפריימים בלבד בלי שמע. מסד נתוני התמונות שלו מעודכן עד יוני 2023, והוא מתקשה מאוד בספירת עצמים בסצנות מורכבות, בהבנת יחסים מרחביים בתלת־ממד ובביצוע הוראות מרובות שלבים. בנוסף, יכולת הזיהוי שלו עבור אנשים מוכרים ומותגים מוגבלת, והוא לא מציין עברית ברשימת השפות הנתמכות בטקסט חזותי.

אותה משפחה

Qwen2-VL יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין טקסט בעברית מתוך תמונות?

התיעוד לא מציין עברית בין השפות הנתמכות, אלא מתמקד בשפות אירופיות, ערבית, סינית, יפנית, קוריאנית ווייטנאמית. שפות מחוץ לרשימה הזו עשויות להניב שגיאות פענוח או הזיות.

איך אפשר לשלוט על צריכת הזיכרון בעת העלאת תמונות?

אפשר להגדיר בעיבוד המקדים ערכי min_pixels ו־max_pixels כדי להגביל את מספר הטוקנים הוויזואליים שהתמונה מייצרת, למשל טווח שנע בין 256 ל־1280 טוקנים, או לקבוע גובה ורוחב מדויקים בכפולות של 28.

האם ניתן להזין קבצי וידאו דרך כתובת URL ברשת?

לא. המודל תומך בכתובות רשת ובקידוד base64 רק עבור תמונות סטילס. בכל מה שנוגע לקטעי וידאו, המימוש הנוכחי מחייב קבצים שנמצאים על מערכת הקבצים המקומית בלבד.

איך מריצים

כדי לטעון 137 ג׳יגה־בייט של משקולות בפורמט bfloat16 על פני 80 שכבות, תצטרכו שרת עם לפחות שני כרטיסי A100 או H100 של 80GB כל אחד, רק בשביל הזיכרון הבסיסי לפני שלוקחים בחשבון את חלון ההקשר של 32,768 טוקנים. הרצה מקומית דורשת התקנה ישירה של transformers מהמאגר הרשמי בגיטהאב יחד עם חבילת העזר הייעודית qwen-vl-utils.

אם אין לכם אשכול מחשוב ייעודי, העלויות של החזקת חומרה כזו פעילה הופכות את ההרצה העצמית ללא משתלמת. במקרה של ניסויים ראשוניים או עומסי עבודה נמוכים, עדיף לפנות לממשק API מנוהל או לבחור בגרסאות הקטנות יותר של 2B ו־8B.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2-VL-72B-Instruct")
print(pipe("שלום"))

הקבצים

49 קבצים במאגר, 137 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ולא כקוד פתוח סטנדרטי. תנאי השימוש הספציפיים לא מפורטים ישירות בעמוד המשקולות, מה שמחייב בדיקה של תנאי הרישיון המקוריים באתר הפרויקט או בקוד המקור לפני שמשלבים אותו במערכת מסחרית.

הרישיון המלא בעמוד המודל ↗