GPT
Q

Qwen2-VL-7B-Instruct-AWQ

קוד פתוח

Qwenapache-2.02024-08-29

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

גרסת קוונטיזציה מכווצת למודל ראייה ושפה חזק, שמאפשרת לנתח תמונות ומסמכים ברזולוציה מקורית וסרטונים ארוכים בלי לחנוק כרטיס מסך בודד.

  • 8.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 6.5 GBמשקל הקבצים
  • 1,634,149הורדות בחודש

מה זה

המודל משלב הבנת טקסט ותמונה ומבוסס על 8.3 מיליארד פרמטרים שנדחסו בשיטת AWQ. החידוש האמיתי בארכיטקטורה הוא היכולת לבלוע תמונות בכל רזולוציה ויחס תצוגה בלי לחתוך אותן לגודל קבוע מראש, לצד תמיכה בניתוח סרטוני וידאו מקומיים באורך של מעל 20 דקות.

במבחני ביצועים כמו DocVQA לקריאת מסמכים הוא שומר על דיוק של 93.10 מול 93.89 במודל המקורי, ובמבחן ההיגיון החזותי MMMU הוא מגיע ל־53.66 לעומת 53.77. הדחיסה כמעט לא פגעה ביכולת שלו לחלץ נתונים מטבלאות וגרפים, אבל קיצצה את צריכת הזיכרון ביותר מחצי.

מתאים ל

  • חילוץ מידע ממסמכים

    קריאת קבלות, טבלאות וסריקות ברזולוציה גולמית בדיוק של 93.1% במבחן DocVQA.

  • ניתוח תוכן מסרטונים

    מענה על שאלות וסיכום של קובצי וידאו מקומיים באורך של יותר מ־20 דקות.

  • סוכן ממשק אוטומטי

    זיהוי אלמנטים במסכי טלפון או מחשב והפעלת ממשקים לפי הוראות טקסטואליות.

איפה זה נופל

הכרטיס מציין בפירוש שהמודל עיוור לחלוטין לסאונד ומנתח רק את הפריימים בווידאו, כך שהוא לא יבין דיבור ללא כתוביות. ספירת עצמים בתמונות צפופות עדיין לא אמינה, ויש לו חולשה מובהקת בהבנת יחסים מרחביים בתלת־ממד. בנוסף, הוא מתקשה לעקוב אחרי הוראות מרובות שלבים, מסד הנתונים החזותי שלו מעודכן רק עד יוני 2023, והוא עלול לפספס מותגים או פרצופים מוכרים.

אותה משפחה

Qwen2-VL יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לתת למודל קישור לסרטון יוטיוב?

לא. המודל תומך בכתובות רשת רק עבור תמונות בודדות, ובסרטונים הוא יודע לקבל קבצים מקומיים בלבד.

כמה זיכרון וידאו באמת צריך כדי להתחיל לעבוד איתו?

עבור תמונה בודדת ושאלה קצרה מספיק כרטיס עם 8 גיגה זיכרון וידאו, שבו הוא צורך כ־7.07 גיגה. אם תרצו לנתח סרטונים או מסמכים ברזולוציה מקורית מלאה, צריכת הזיכרון תעלה מהר מאוד ותדרוש כרטיס של 16 או 24 גיגה ומעלה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 8 גיגה זיכרון וידאו עבור קלטים קצרים, שבהם הוא תופס כ־7.07 גיגה ומייצר כ־32 טוקנים לשנייה. אם אתם מתכוונים להזין מסמכים עמוסים או רצפי תמונות שממלאים את ההקשר עד 30,720 טוקנים, תצטרכו כרטיס של 40 או 80 גיגה, כי צריכת הזיכרון מזנקת שם ל־35 גיגה.

ההבדל מול גרסאות GPTQ הוא בעיקר תאימות לספריות שונות, כשגרסת AWQ מציעה מהירות יציבה מאוד בהקשרים ארוכים. התקנה דורשת את transformers ישירות מגיטהאב ואת ספריית qwen-vl-utils. אם אין לכם חומרה ייעודית עם מספיק זיכרון וידאו לטפל בחלונות הקשר גדולים, עדיף להשתמש ב־API חיצוני במקום לקרוס על מגבלות זיכרון מקומיות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2-VL-7B-Instruct-AWQ")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 המלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בלי לשלם תמלוגים ובלי חובה לפתוח את הקוד שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗