GPT
C

cogagent-vqa-hf

קוד פתוח

zai-orgapache-2.02023-12-16

  • transformers
  • safetensors
  • text-generation
  • custom_code
  • en

מודל חזותי שמנתח תמונות ברזולוציה גבוהה ועונה על שאלות לגביהן בסבב בודד. הוא מתאים למי שצריך לפענח מסכים, מסמכים או גרפים מורכבים במענה ישיר.

  • 18Bפרמטרים
  • 2,048טוקנים בהקשר
  • 34.1 GBמשקל הקבצים
  • 1,796הורדות בחודש

מה זה

מדובר במודל שפה חזותי שמבוסס על CogVLM, וכולל 11 מיליארד פרמטרים חזותיים לצד 7 מיליארד פרמטרים שפתיים. החידוש המרכזי כאן מול מודלים אחרים בסדר הגודל הזה הוא התמיכה בקלט תמונה ברזולוציה של 1120 על 1120 פיקסלים. הרזולוציה הזו, יחד עם שיפורים בלמידה על משימות קריאת טקסט, מאפשרת לו לזהות פרטים קטנים בתוך צילומי מסך של אתרים ותוכנות מחשב.

גרסת ה־VQA מיועדת ספציפית לדיאלוג חזותי של שאלה ותשובה בודדת. המפתחים מדווחים על תוצאות מובילות בתשעה מבחני ביצועים שונים, ביניהם כאלה שבודקים הבנת מסמכים, ניתוח גרפים וקריאת טקסט מתוך תמונה. המשמעות בפועל היא יכולת טובה לחלץ נתונים מדויקים מתמונה בלי ללכת לאיבוד, כל עוד שואלים שאלה ישירה אחת.

מתאים ל

  • ניתוח צילומי מסך של תוכנות

    התמיכה ברזולוציית 1120 על 1120 מאפשרת לו לקרוא כפתורים וטקסט קטן בממשקי מחשב ואפליקציות.

  • חילוץ נתונים מגרפים ומסמכים

    הוא מציג ביצועים מובילים במבחנים כמו DocVQA ו־ChartQA למענה על שאלות מתוך קבצים חזותיים.

  • מענה לשאלות על תמונה בודדת

    הארכיטקטורה של גרסת ה־vqa אופטימלית לפתרון בעיות נקודתיות של שאלה ותשובה בסבב יחיד.

איפה זה נופל

הגרסה הזו מכוונת למענה של סיבוב אחד בלבד. היא לא נועדה לשיחות מתמשכות מול משתמש, ועבור יכולות סוכן מלאות שמתכננות צעדים ומחזירות קואורדינטות המפתחים מכוונים לגרסה האחרת. בנוסף, חלון ההקשר מוגבל ל־2,048 טוקנים בלבד, מה שמגביל מאוד את אורך השאלות והתשובות. המודל גם מוגדר לשפה האנגלית בלבד, כך שלא כדאי להסתמך עליו בעיבוד טקסט בעברית.

שאלות
נפוצות

האם המודל יודע לתפעל ממשקים כמו סוכן אוטונומי?

הגרסה הזו חזקה יותר בשאלות ותשובות בסבב בודד. למשימות של סוכן שצריך להחזיר תוכנית פעולה וקואורדינטות של ממשק, המפתחים ממליצים להשתמש בגרסת ה־chat.

האם אפשר להשתמש בו במוצר מסחרי?

כן, אך השימוש המסחרי מחייב הרשמה בטופס של היוצרים. רק לאחר ההרשמה והסכמה לתנאי הרישיון המיוחד שלהם ניתן להשתמש במשקלים ללא תשלום.

האם הוא מתאים לעיבוד טקסטים בעברית מתוך תמונות?

המודל הוגדר ואומן עבור השפה האנגלית בלבד. אם יש צורך לפענח ממשקים או מסמכים בעברית, הוא ככל הנראה לא יספק מענה אמין.

איך מריצים

כדי להריץ אותו משתמשים בספריית transformers עם קוד הדגמה שמריץ bfloat16 ישירות מהטרמינל. המשקל הכולל של הקבצים מגיע ל־34.1 גיגה בייט, כך שצריך כרטיס גרפי עם זיכרון וידאו ייעודי גדול מספיק להחזיק את כל המשקלים האלה ברמת דיוק כזו.

מי שצריך סוכן שיודע לבצע פעולות מרובות שלבים על ממשק או לנהל שיחה מתמשכת על תמונה, עדיף שיבחר בגרסת ה־chat ולא בזו. בנוסף, אם אין לכם חומרה ייעודית חזקה, שווה לשקול פתרון שמנוהל במקום אחר.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/cogagent-vqa-hf")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת רישיון אפאצ'י 2.0, אבל משקלי המודל דורשים רישום מראש בטופס חיצוני אם רוצים להשתמש בהם למטרות מסחריות. הרישום מאפשר שימוש מסחרי ללא עלות, אך מותנה בעמידה בכל תנאי הרישיון של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗