GPT
Q

Qwen-VL-Chat

קוד פתוח

Qwenרישיון לא דווח2023-08-20

  • transformers
  • pytorch
  • qwen
  • text-generation
  • custom_code

יש כאן גם סקירה על Qwen עצמו.

זהו מודל שיחה רב מודלי שמקבל תמונות וטקסט ומחזיר טקסט יחד עם תיבות סימון למיקום עצמים. מתאים במיוחד למי שמחפש קריאת מסמכים ואיתור עצמים ברזולוציה גבוהה באנגלית ובסינית.

  • 8,192טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 15,200הורדות בחודש
  • 384לייקים

מה זה

המודל פותח על ידי Alibaba Cloud ומשלב יכולות ראייה ושיחה. מעבר לתשובות טקסט על שאלות חופשיות מול תמונה, הוא מקבל ופולט תיבות סימון ומסוגל לאתר עצמים בתמונה ברמת פירוט גבוהה. הוא עובד ברזולוציית קלט של 448 על 448 פיקסלים, כפול מרוב המודלים הפתוחים המקבילים שהסתפקו ב־224, מה שמשפר משמעותית את היכולת לקרוא טקסט מתוך מסמכים וטבלאות בלי לחתוך את התמונה מראש.

במדדי ביצועים כמו TouchStone הוא הגיע לציון 645.2 באנגלית ו־401.2 בסינית, תוצאות שמציבות אותו מעל מודלים כמו LLaVA ו־InstructBLIP. במבחני זיהוי טקסט בתוך תמונה כמו TextVQA ו־DocVQA הוא עוקף מודלים גדולים ממנו, ומסוגל לזהות עצמים בסינית גם בלי שעבר אימון ייעודי על נתוני איתור בשפה זו.

מתאים ל

  • חילוץ מידע מטבלאות ומסמכים

    רזולוציית 448 פיקסלים מאפשרת לו לקרוא טקסט וגרפים באנגלית בלי צורך לחתוך את התמונה מראש.

  • איתור וסימון עצמים בתמונות

    הוא מחזיר קואורדינטות של תיבות סימון לפי תיאור מילולי חופשי ישירות כחלק מהתשובה.

  • השוואת מוצרים מכמה תמונות

    הארכיטקטורה תומכת בקלט משולב של טקסט ומספר תמונות באותה שיחה עד למגבלת הזיכרון.

איפה זה נופל

המודל מוגדר רשמית רק לאנגלית ולסינית. אין בו שום תמיכה מובנית בעברית, כך שאי אפשר להסתמך עליו לחילוץ נתונים בעברית מתמונות או לניהול שיחה מקומית. בנוסף, חלון של 8,192 טוקנים נשמע מרווח, אבל תמונה אחת לוקחת 258 טוקנים עוד לפני שהתחלתם לשאול שאלות, ושיחה מרובת תמונות עלולה לנצל את הזיכרון מהר מאוד. אם הנתונים שלכם דורשים דיוק מוחלט בקריאת תרשימים עמוסים, הביצועים שלו עדיין נמוכים ממודלים ייעודיים שנבנו מראש רק למשימה הזו.

אותה משפחה

Qwen-VL יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין תמונות עם טקסט בעברית?

לא. המודל אומן ותועד רק עבור אנגלית וסינית, ואין לו יכולת מוכחת לזהות טקסט עברי או לענות בעברית.

כמה זיכרון כרטיס מסך צריך כדי להריץ אותו מקומית?

הגרסה המלאה דורשת לפחות 22.6 גיגה בייט זיכרון GPU, ומגיעה ל־28 גיגה בייט בהקשר מלא. אם משתמשים בגרסת Int4 המכווצת, צריכת הזיכרון יורדת לכ־12 עד 17 גיגה בייט.

איך מריצים

הקבצים שוקלים 18 גיגה בייט בדיוק bfloat16 ודורשים כרטיס מסך עם לפחות 24 גיגה בייט זיכרון לעבודה רגילה, ומעל 28 גיגה בייט אם מנצלים את מלוא חלון ההקשר של 8,192 טוקנים. אם אין לכם A100 או חומרה מקבילה, כדאי לפנות ישירות לגרסת ה־Int4. גרסת ה־Int4 מורידה את צריכת הזיכרון ל־11.82 גיגה בייט, רצה בקצב של כ־37 טוקנים לשנייה ומתאימה לכרטיסים נגישים יותר בלי פגיעה מורגשת בתוצאות הבנצ'מרק.

ההרצה מתבצעת דרך ספריית transformers של פייתון, ודורשת PyTorch 1.12 ומעלה יחד עם CUDA 11.4 ומעלה. אם אין לכם שרת ייעודי זמין, עדיף להשתמש ב־API שהחברה מציעה דרך DashScope במקום להתמודד עם עלויות אחזקת כרטיס תעשייתי.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen-VL-Chat")
print(pipe("שלום"))

הרישיון

בדף הנתונים לא דווח רישיון סגור או קוד פתוח סטנדרטי. לפי התיעוד המצורף, חוקרים ומפתחים רשאים להשתמש בקוד ובמשקלים, ושימוש מסחרי מותנה במילוי טופס שאלון ייעודי ובקשת אישור ישירה מול Alibaba Cloud. אם אתם בונים מוצר מסחרי, אי אפשר לשלב אותו בלי לעבור קודם את תהליך הרישום הזה.

הרישיון המלא בעמוד המודל ↗