GPT
Q

Qwen2-VL-7B-Instruct-GPTQ-Int4

קוד פתוח

Qwenapache-2.02024-08-29

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

גרסת קוונטיזציה של מודל ראייה ושפה שמכווצת את הדרישות לחומרה ביתית. מיועד למי שרוצה ניתוח תמונות ווידאו בלי לשלם על שרת ענק.

  • 8.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 6.5 GBמשקל הקבצים
  • 6,712הורדות בחודש

מה זה

הגרסה הזו לוקחת את מודל 8.3 מיליארד הפרמטרים של סדרת Qwen2-VL ומכווצת אותו לדיוק של 4 ביט בשיטת GPTQ. הוא מנתח תמונות ברזולוציה דינמית, קורא מסמכים, מבין סרטונים באורך של מעל 20 דקות ומסוגל לקרוא טקסט בשפות רבות, כולל ערבית, יפנית ושפות אירופאיות.

במבחני הביצועים, הירידה בדיוק לעומת משקלי המקור כמעט לא מורגשת. במבחן DocVQA להבנת מסמכים הוא משיג 93.16 נקודות לעומת 93.89 במקור, ובמבחן MathVista הוא אפילו עוקף את גרסת הדיוק המלא עם 60.30 נקודות. זה אומר שבמשימות מעשיות של קריאת קבלות או פענוח גרפים, הקוונטיזציה לא פגעה ביכולת.

מתאים ל

  • חילוץ נתונים ממסמכים

    משיג 93.16 במבחן DocVQA ומתאים לסריקת קבלות, טפסים וחשבוניות ישירות למאגר מידע.

  • ניתוח תנועה בווידאו

    מזהה אירועים ופעולות בסרטונים של 20 דקות בלי צורך בשרתים ייעודיים כבדים.

  • אוטומציה ויזואלית לממשקים

    מפענח צילומי מסך מטלפונים ומחשבים לצורך קבלת החלטות והפעלת סוכנים אוטונומיים.

איפה זה נופל

בסרטוני וידאו אין תמיכה בסאונד, כך שהניתוח מבוסס על פריימים בלבד. מאגר המידע מוגבל עד יוני 2023, והוא מתקשה בזיהוי מותגים, אנשים מוכרים והבנת יחסים תלת־ממדיים במרחב.

בנוסף, הכרטיס מודה מפורשות שהמודל לא סופר אובייקטים במדויק בסצנות עמוסות, ומאבד כיוון בהוראות מורכבות עם כמה שלבים. בעברית ספציפית השפה לא מוגדרת רשמית בתמיכה של המודל, ולכן חובה לבדוק אותו על טקסט מקומי לפני שמשלבים אותו בזרימת עבודה.

אותה משפחה

Qwen2-VL יצא ב־9 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל שומע מה קורה בסרטון?

לא. המודל מנתח אך ורק את התמונה והווידאו הוויזואלי, ואין לו רכיב שמע בכלל.

איזה כרטיס מסך צריך כדי להריץ אותו במחשב?

לתמונות בודדות וקלט קצר מספיק כרטיס עם 8 גיגה זיכרון. לקבצי וידאו ארוכים שמגיעים לקצה חלון ההקשר תצטרכו כרטיס מקצועי עם 40 גיגה זיכרון לפחות.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של 8 גיגה זיכרון לפחות. בקלט קצר הוא תופס 7.2 גיגה זיכרון ומייצר כ־42 טוקנים בשנייה על חומרה תואמת, מה שמאפשר להרים אותו על כרטיס ביתי פשוט. ככל שמזינים סרטונים ארוכים יותר צריכת הזיכרון מזנקת, ובהקשר של 30,720 טוקנים הוא כבר דורש מעל 35 גיגה.

ההבדל מגרסת ה־AWQ המקבילה זניח בביצועים, אבל GPTQ מעט מהיר יותר בקלטים קצרים. אם אתם צריכים לנתח קטעי וידאו ארוכים ברצף ואין לכם כרטיס שרת מקצועי, עדיף לפנות ל־API מסחרי במקום לנסות לדחוף את ההקשר המלא לכרטיס מקומי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2-VL-7B-Instruct-GPTQ-Int4")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הוויתור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗