GPT
C

cogvlm-chat-hf

קוד פתוח

zai-orgapache-2.02023-11-16

  • transformers
  • safetensors
  • text-generation
  • custom_code
  • en

זה מודל ראייה ושפה שמחבר מומחה ויזואלי ישירות לתוך שכבות הטקסט. הוא מתאים למי שרוצה ביצועים ברמה של מודלים ענקיים אבל בחבילה של שבעה עשר מיליארד פרמטרים.

  • 18Bפרמטרים
  • 2,048טוקנים בהקשר
  • 32.9 GBמשקל הקבצים
  • 675הורדות בחודש

מה זה

הארכיטקטורה כאן מחלקת את העבודה בצורה ברורה. יש עשרה מיליארד פרמטרים שמוקדשים לראייה ושבעה מיליארד לשפה, כשהחיבור נעשה דרך מודול מומחה ויזואלי ייעודי ולא רק מתאם שטחי בין התמונה למילים. המבנה הזה נותן לו להבין פרטים קטנים בתמונה במקום רק לנחש תיאור כללי לפי ההקשר.

במבחנים הקלאסיים של הבנת תמונה ושאלות על תמונות, כמו NoCaps וניתוח אזורים בתוך RefCOCO, הוא עקף מודלים גדולים ממנו בהרבה והגיע לתוצאות שמשתוות למודלים של חמישים וחמישה מיליארד פרמטרים. המשמעות בפועל היא יכולת איתור מדויקת של אובייקטים ומענה ישיר לשאלות מורכבות על סמך מה שמופיע בתמונה, ולא רק ניחוש של טקסט שנראה סביר.

מתאים ל

  • זיהוי ומיקום עצמים בתמונה

    התוצאות הגבוהות במבחני RefCOCO הופכות אותו לכלי מדויק לאיתור אובייקטים וסימונם לפי פקודות טקסט.

  • מענה לשאלות על מסמכים

    הוא הגיע למקום השני במבחני TextVQA, ולכן מתאים לחילוץ תשובות מתרשימים ומסמכים באנגלית.

  • שיחה מבוססת תמונה

    שילוב המומחה הוויזואלי נותן מענה מפורט על פרטים קטנים בצילום במסגרת שיחה קצרה באנגלית.

איפה זה נופל

חלון ההקשר עומד על 2,048 טוקנים בלבד. ברגע שמכניסים תמונה ברזולוציה גבוהה יחד עם שיחה מתמשכת, המקום נגמר מהר מאוד ואי אפשר לנהל איתו דיאלוגים ארוכים על אותו צילום. בנוסף, המודל אומן רק על אנגלית, כך שכל ניסיון לתשאל אותו בעברית על תמונות ייתקל בחוסר הבנה או בפליטת ג׳יבריש. הוא גם דורש שרשרת תלויות תוכנה מדויקת מאוד כדי לעבוד בלי לקרוס בזמן חלוקת הזיכרון.

אותה משפחה

cogvlm יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב אישי עם כרטיס בודד?

לא על כרטיס רגיל. המודל דורש כמעט ארבעים גיגה זיכרון גרפי לצורך הסקה בלבד. הפתרון המעשי היחיד מחוץ לחוות שרתים הוא פיצול על גבי שני כרטיסי עשרים וארבעה גיגה.

האם המודל מבין עברית?

הוא הוגדר ואומן לשפה האנגלית בלבד. פקודות או שאלות בעברית לא יעבדו בצורה תקינה, ולכן יש לשלוח את השאילתות באנגלית בלבד.

איך מריצים

כדי להריץ אותו להסקה צריך קרוב לארבעים גיגה זיכרון גרפי. זה אומר שאי אפשר להסתפק בכרטיס ביתי רגיל, וצריך או כרטיס שרת בודד של ארבעים ושמונה גיגה, או לחלק אותו באמצעות ספריית accelerate על פני שני כרטיסים של עשרים וארבעה גיגה יחד עם שש עשרה גיגה זיכרון מערכת.

אם אין לכם שרת ייעודי כזה פועל ברקע, העלות של החזקת חומרה כזו רק בשביל בדיקות מזדמנות לא משתלמת. במצב כזה עדיף לגשת ישירות לשירות ענן או להשתמש בהדגמה החיה של הפרויקט לפני שמתחילים להוריד שלושים ושלושה גיגה של משקלים.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/cogvlm-chat-hf")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת רישיון אפאצ׳י 2.0, אבל המשקלים כפופים להסכם נפרד. הם פתוחים לגמרי למחקר אקדמי, ואילו שימוש מסחרי מותנה במילוי טופס שאלון ורישום מראש מול המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗