GPT
I

InternVL2-Llama3-76B

קוד פתוח

OpenGVLabllama32024-07-15

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

מודל מולטימודלי כבד שמחבר מודל ראייה של 6B עם שפת Llama 3 70B. הוא מיועד למי שרוצה ביצועים קרובים למודלים מסחריים סגורים בניתוח מסמכים ותמונות, עם שליטה מלאה בקוד ובמשקלים.

  • 76Bפרמטרים
  • 142 GBמשקל הקבצים
  • 344הורדות בחודש
  • 213לייקים

מה זה

הארכיטקטורה משלבת מקודד ראייה מסוג InternViT-6B, מקרן MLP ואת מודל השפה Hermes-2-Theta-Llama-3-70B. החיבור הזה מאפשר קריאה של תמונות ברזולוציה משתנה, ניתוח וידאו לפי פריימים ושיחה רב שלבית עם טקסט ארוך הודות לחלון הקשר של 8k טוקנים.

במבחני OCR ומסמכים כמו DocVQA ו־OCRBench הוא עוקף מודלים סגורים כמו GPT-4o ו־Claude 3.5 Sonnet, ומראה שקריאת טקסט מתוך תמונה היא הצד החזק שלו. לעומת זאת, במבחני היגיון רב תחומי מורכבים כמו MMMU הוא מקבל ציון 58.2, שזה משמעותית מתחת למובילים המסחריים שמגיעים לאזור ה־69.

מתאים ל

  • ניתוח מסמכים וטבלאות

    משיג ציונים גבוהים במיוחד במבחני DocVQA ו־OCRBench, מה שמבטיח פענוח מדויק של קבלות ותרשימים.

  • איתור אזורים בתמונה

    מציג דיוק מעל 90 אחוז במשימות grounding, כולל יכולת להחזיר קואורדינטות של אובייקטים לפי תיאור טקסטואלי.

  • השוואה בין מספר תמונות

    מטפל ברצף של תמונות מרובות בשיחה אחת, בזכות ארכיטקטורה שמחלקת ומאחדת אריחי תמונה שונים.

איפה זה נופל

למרות הגודל העצום, ביצועי הווידאו שלו בינוניים למדי. במבחני וידאו כמו Video-MME הוא מגיע לאזור ה־61 עד 62 נקודות, הרחק מאחורי המתחרים הגדולים, כי הוא דוגם רק 16 פריימים מכל סרטון ומקטין אותם לגודל אחיד. הכרטיס מזהיר במפורש מפני פלט שעלול לכלול הטיות, אפליה ותוכן פוגעני עקב אופיו ההסתברותי של המודל.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת עם GPU יחיד של 80GB?

לא. אפילו בקוונטיזציה של 8 ביט המודל דורש לפחות שני כרטיסים של 80GB. הרצה ללא קוונטיזציה ב־bfloat16 דורשת לפחות שלושה כרטיסים כאלה.

איך המודל מתמודד עם תמונות ברזולוציה גבוהה?

הוא משתמש בעיבוד דינמי שמחלק תמונות גדולות למספר אריחים של 448 על 448 פיקסלים. השיטה הזו שומרת על פרטים קטנים ומאפשרת זיהוי טקסט מדויק בלי לכווץ את התמונה כולה.

האם הוא מתאים לניתוח סרטי וידאו ארוכים?

פחות מומלץ. התהליך הנוכחי דוגם רק 16 פריימים מכל סרטון ומקטין אותם, ולכן במבחני וידאו הוא מפגר בבירור אחרי מודלים ייעודיים.

איך מריצים

המשקלים תופסים 142 גיגה בייט ומחייבים תשתית כבדה. בטעינה רגילה של bfloat16 תצטרכו לפחות שלושה כרטיסי 80GB כמו A100 או H100. אם מפעילים קוונטיזציה של 8 ביט אפשר להסתפק בשני כרטיסים של 80GB.

הקוד דורש חלוקת שכבות ידנית כדי למנוע שגיאות זיכרון בין המעבדים, והרצה שלו מעל transformers דורשת trust_remote_code. אם אתם לא מחזיקים אשכול שרתים ייעודי ומאובטח, כנראה שעדיף להשתמש ב־API מנוהל שחוסך את עלויות החומרה והתחזוקה האלה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL2-Llama3-76B")
print(pipe("שלום"))

הקבצים

49 קבצים במאגר, 142 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־llama3, שמבוסס על תנאי השימוש של מטא למודלי Llama 3. הוא מאפשר שימוש מסחרי ומחקר, כל עוד עומדים במגבלות הרישיון המקוריות של מטא, כולל הגבלות על מספר המשתמשים הפעילים בחודש ואיסור שימוש בפלטים לאימון מודלים מתחרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗