GPT
C

cogvlm2-llama3-chat-19B

קוד פתוח

zai-orgother2024-05-16

  • transformers
  • safetensors
  • text-generation
  • chat
  • cogvlm2

מודל ראייה ושפה שמחבר מומחה ויזואלי לשלד של לאמה 3. הוא מיועד למי שצריך פענוח מסמכים ותמונות ברזולוציה גבוהה בלי להסתמך על שירות ענן סגור.

  • 20Bפרמטרים
  • 8,192טוקנים בהקשר
  • 36.3 GBמשקל הקבצים
  • 9,956הורדות בחודש

מה זה

הארכיטקטורה כאן לוקחת את Meta-Llama-3-8B-Instruct ומוסיפה לו שכבות ייעודיות לעיבוד תמונה, מה שמביא את כל העסק לכמעט 20 מיליארד פרמטרים. המודל מתמקד בהבנת תמונות ושיחה באנגלית, עם תמיכה ברזולוציית קלט של 1344 על 1344 פיקסלים וחלון הקשר של 8,192 טוקנים.

במבחני ביצועים שמבוססים על קריאת טקסט ישירות מהפיקסלים בלי כלי זיהוי תווים חיצוניים, הוא מציג מספרים מרשימים מאוד. במבחן DocVQA להבנת מסמכים הוא קיבל ציון של 92.3, וב־TextVQA הוא הגיע ל־84.2, תוצאות שעוקפות מודלים מסחריים גדולים כמו GPT-4V ו־Claude 3 Opus בטבלה שפורסמה. הוא חזק במיוחד במשימות שדורשות שילוב בין קריאה ויזואלית מדויקת להסקה לוגית.

מתאים ל

  • חילוץ נתונים מדוחות וטבלאות

    הוא השיג ציון 92.3 ב־DocVQA וקולט תמונות עד 1344 על 1344 פיקסלים, מה שמאפשר קריאת טקסט קטן בלי OCR חיצוני.

  • ניתוח גרפים ותרשימים באנגלית

    עם תוצאה של 81.0 במבחן ChartQA, הוא מצטיין בהבנת מגמות ותרשימים מורכבים ישירות מתוך התמונה.

  • מענה על שאלות מתמונות

    התוצאה של 83.3 במבחן VCR_EASY מראה יכולת טובה להבין הקשר ויזואלי ולענות עליו בשיחה חופשית באנגלית.

איפה זה נופל

למרות ההצטיינות במסמכים, במבחן MMMU שבודק ידע רב-תחומי ברמה אקדמית הוא קיבל 44.3 בלבד, הרחק מ־GPT-4V שהשיג 56.8 או Claude 3 Opus עם 59.4. זה מראה שהידע הכללי וההיגיון הרחב שלו מוגבלים בגלל בסיס ה־8B. בנוסף, גרסה זו מוגדרת רשמית לשפה האנגלית בלבד, ואין בכרטיס שום תיעוד לתמיכה בעברית, כך שלא כדאי לבנות עליו לפענוח מסמכים מקומיים.

שאלות
נפוצות

האם המודל תומך במסמכים בעברית?

הכרטיס מציין תמיכה באנגלית בלבד עבור גרסה זו, והמפתחים שחררו גרסה מקבילה רק לסינית ולאנגלית. אין שום תיעוד או בדיקה ליכולות קריאה בעברית, ובדרך כלל מודלים שלא אומנו על עברית נכשלים בזיהוי תווים מקומיים.

למה המודל שוקל 19B אם הבסיס שלו הוא Llama 3 8B?

המשקל הנוסף מגיע מרכיב הראייה המובנה ומשכבות מומחה ויזואליות שנוספו ישירות לתוך ארכיטקטורת המודל. התוספת הזו מקפיצה את מספר הפרמטרים לכמעט 20 מיליארד, ולכן נדרש זיכרון וידאו גדול משמעותית בהשוואה למודל שפה רגיל של 8B.

איך מריצים

כדי להריץ 36.3 גיגה-בייט של משקולות בזיכרון תצטרכו כרטיס מסך רציני עם 48 גיגה-בייט VRAM כמו A6000 או A100, אלא אם כן תבצעו קוונטיזציה לארבעה או שמונה ביט כדי לדחוס אותו לחומרה צנועה יותר. המודל נתמך ישירות דרך ספריית transformers, אבל הגודל שלו דורש משאבים כבדים ביחס למודלי 8B רגילים.

המפתחים מפנים גם ל־API בפלטפורמת ZhipuAI למודל GLM-4V הגדול יותר. אם יש לכם רק שרת מקומי קטן בלי כרטיסים גרפיים מקצועיים, פנייה ל־API חיצוני תהיה זולה ופשוטה בהרבה מהחזקת תשתית ייעודית למודל של 20B.

from transformers import pipeline

pipe = pipeline("text-generation", model="zai-org/cogvlm2-llama3-chat-19B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כמותאם אישית ומפנה לשילוב בין תנאי CogVLM2 לתנאי השימוש של Meta עבור Llama 3. זה אומר שאתם כפופים להגבלות של מטא, כולל חובת ציון המקור ומגבלות על היקף משתמשים חודשי אם מגיעים למספרים עצומים. כדי להשתמש בו במוצר מסחרי חובה לקרוא את קובץ הרישיון המקורי במאגר ולוודא שהשימוש שלכם עומד בכל הדרישות.

הרישיון המלא בעמוד המודל ↗