GPT
Q

Qwen-VL

קוד פתוח

Qwenרישיון לא דווח2023-08-18

  • transformers
  • pytorch
  • qwen
  • text-generation
  • custom_code

יש כאן גם סקירה על Qwen עצמו.

זה מודל ראייה ושפה שמקבל תמונות וטקסט ומחזיר טקסט יחד עם תיבות איתור מדויקות. הוא מתאים למי שחייב לזהות מיקומי עצמים או לקרוא מסמכים ישירות מתמונה.

  • 8,192טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 5,956הורדות בחודש
  • 286לייקים

מה זה

המודל הזה נבנה כגרסת הראייה של סדרת Qwen מבית עליבאבא קלאוד, כשהוא מבוסס על שילוב עיבוד תמונה ברזולוציית 448 על 448 יחד עם מודל שפה של שבעה מיליארד פרמטרים. היכולת המרכזית שלו היא שילוב קלט של תמונות, טקסט וקואורדינטות של תיבות איתור, והפקת תשובות טקסטואליות שמכילות בעצמן מיקומים במרחב התמונה.

במבחני ביצועים, ההחלטה לעבוד ברזולוציית 448 מקצה לקצה בלי לחתוך את התמונה מראש מאפשרת לו להתמודד עם מסמכים ותרשימים טוב יותר ממודלים מוקדמים שהוגבלו ל־224. במבחני הבנת מסמכים וטקסט בתמונות הוא רושם 65.1 ב־DocVQA ו־65.7 ב־ChartQA, ובמשימות איתור עצמים לפי תיאור הוא מגיע ל־89.36 ב־RefCOCO, מעל מודלים כפולים ממנו בגודל. מדובר בגרסת הבסיס המאומנת מראש ולא בגרסת השיחה, כך שהוא מכוון בעיקר להשלמת משימות ספציפיות ופחות לדיאלוג חופשי.

מתאים ל

  • חילוץ נתונים מטבלאות וגרפים

    הוא מגיע לתוצאה של 65.7 ב־ChartQA ויודע לקרוא תוויות ומספרים ישירות מתוך תרשימים באנגלית ובסינית.

  • איתור עצמים לפי תיאור טקסטואלי

    הוא מחזיר תיבות איתור ישירות כפלט טקסט, עם ציון של 89.36 במבחן RefCOCO.

  • תיאור תמונות באנגלית וסינית

    הוא מוביל במבחן Flickr30K עם ציון 85.8 ביצירת תיאור מפורט לתמונות ללא אימון מוקדם על הדאטהסט.

איפה זה נופל

זהו מודל בסיס ולא גרסת צ'אט, מה שאומר שהוא יתקשה לעקוב אחרי הוראות שיחה חופשיות בלי כיוונון עדין נוסף. הכרטיס מפרט תמיכה באנגלית ובסינית בלבד, כך שאין כאן תמיכה מובנית בעברית, לא בזיהוי תווים בתמונה ולא בפלט הטקסטואלי. בנוסף, אף על פי שרזולוציית 448 עדיפה על 224, היא עדיין מוגבלת מול טקסטים קטנים במיוחד במסמכים צפופים, שבהם מודלים ייעודיים ברזולוציות גבוהות יותר יציגו דיוק עדיף.

אותה משפחה

Qwen-VL יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מסוגל לנהל שיחה ישירה עם משתמש?

לא בצורה חלקה, כי זהו מודל הבסיס המאומן מראש ולא גרסת הצ'אט. אם המטרה שלכם היא בוט אינטראקטיבי, עדיף לפנות לגרסת Qwen-VL-Chat שעברה התאמה לשיחות.

האם אפשר להשתמש בו לניתוח מסמכים בעברית?

המודל אומן ותועד רק עבור אנגלית וסינית. הוא לא מיועד לזיהוי אותיות בעברית מתוך תמונות וכנראה ייכשל בקריאת טקסט מקומי.

מה צריך כדי להריץ אותו מקומית על שרת פרטי?

תצטרכו מעבד גרפי עם לפחות 24 גיגה בייט של זיכרון ייעודי כדי להחזיק את 18 הגיגה בייט של הקבצים ב־bfloat16, יחד עם פייתון 3.8 וסביבת CUDA 11.4 ומעלה.

איך מריצים

טעינת המודל מתבצעת ישירות דרך ספריית transformers בפייתון 3.8 ומעלה, עם PyTorch בגרסה 1.12 לפחות וסביבת CUDA 11.4 ומעלה למעבדים גרפיים. הקבצים שוקלים 18 גיגה בייט בדיוק bfloat16 על פני 32 שכבות, מה שמחייב כרטיס מסך עם לפחות 24 גיגה בייט זיכרון כדי לבצע הסקה מקומית בלי לקרטע.

מי שאין לו כרטיס מקצועי ייעודי יתקשה להריץ אותו מקומית. לחלופין, עליבאבא מספקת גישה לשירות דרך API ייעודי בענן DashScope שלהם וגרסאות מכווצות כמו Int4, כך שאם המטרה היא בדיקת היתכנות מהירה בלי לתחזק חומרה כבדה, עדיף להשתמש בנקודת הקצה שלהם.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen-VL")
print(pipe("שלום"))

הרישיון

בעמוד המודל הרשמי לא הוזן שדה רישיון תקני, אך בטקסט עצמו החברה מציינת כי שימוש מסחרי מותנה במילוי טופס בקשה ייעודי וקבלת אישור. כל עוד לא קיבלתם אישור רשמי, אין להפיץ את המשקלים או להטמיע אותם ישירות במוצר מסחרי פעיל.

הרישיון המלא בעמוד המודל ↗