GPT
I

InternVL2_5-8B-MPO

קוד פתוח

OpenGVLabmit2024-12-20

  • transformers
  • tensorboard
  • safetensors
  • internvl_chat
  • feature-extraction

זהו מודל מולטימודלי בגודל שמונה מיליארד פרמטרים שמשלב עיבוד תמונה וטקסט. הוא נבנה כדי לתת ביצועי פענוח מסמכים וחשיבה חזותית בלי להזדקק לחוות שרתים ענקית.

  • 8.1Bפרמטרים
  • 15.0 GBמשקל הקבצים
  • 1,275הורדות בחודש
  • 48לייקים

מה זה

הארכיטקטורה משלבת מודל ראייה בשם InternViT של 300 מיליון פרמטרים עם מודל השפה internlm2_5-7b-chat דרך שכבת קישור אקראית של MLP. התמונות נקלטות ברזולוציה דינמית שמחלקת אותן לחלקים של 448 על 448 פיקסלים, לצד דחיסה שמצמצמת את כמות הטוקנים החזותיים ברבע. בנוסף לטיפול בתמונה בודדת, הוא מקבל גם כמה תמונות במקביל או מקטעי וידאו דרך חילוץ פריימים.

האותיות MPO בשם מסמנות אימון שמשלב העדפות יחסיות יחד עם מדדי איכות מוחלטים על מאגר של שלושה מיליון דוגמאות. במבחני ביצועים רואים שזה דחף בעיקר את היכולות הטכניות הממוקדות. בבדיקת OCRBench הציון עלה מ־82.1 בגרסה הרגילה ל־88.3, וב־MathVista המודל הגיע ל־68.9 לעומת 64.5, מה שאומר שהוא מדויק יותר בקריאת נתונים מורכבים מתמונות אבל השיפור שלו בהבנה כללית של תמונות רגילות נשאר מתון.

מתאים ל

  • חילוץ נתונים מטבלאות ודוחות

    התוצאה הגבוהה במבחן OCRBench של 88.3 הופכת אותו למתאים לקריאת טקסטים צפופים ומסמכים סרוקים.

  • פתרון בעיות מתמטיקה חזותיות

    הוא השיג 68.9 במבחן MathVista, כך שהוא מסוגל להבין תרשימים הנדסיים ונוסחאות מתוך שרטוטים.

  • השוואה בין מספר תמונות

    הקוד תומך בהזנת כמה תמונות יחד ומאפשר לזהות הבדלים ושינויים בין צילומים שונים ברצף.

איפה זה נופל

למרות האימון המשופר, במבחן ההזיות HallusionBench המודל קיבל ציון של 51.4 בלבד. זה אומר שבמקרים שבהם התמונה לא חד־משמעית או כשהשאלה מטעה, הוא עדיין ימציא פרטים בביטחון. בנוסף, במבחן הידע האקדמי הרב־תחומי MMMU הגרסה הזו קיבלה 54.9, ציון שנמוך יותר מגרסת ה־8B הרגילה ללא MPO שעמדה על 56.2. אסור להסתמך עליו לחילוץ עובדות קריטיות בלי לבצע בדיקות אימות חיצוניות.

שאלות
נפוצות

האם המודל תומך בווידאו ישירות?

הוא לא מקבל קובץ וידאו גולמי כקלט יחיד ברמת הרשת, אלא דורש פירוק של הווידאו למערך פריימים דרך ספריית decord. הקוד המצורף מחלק את הסרטון למספר מקטעים מוגדר מראש ומעביר אותם לעיבוד כרצף תמונות.

האם כדאי לשדרג מגרסת InternVL2.5-8B הרגילה?

רק אם המטרה העיקרית שלכם היא קריאת טקסט מתמונה או פתרון תרגילים וגרפים, שם נרשמה עלייה ניכרת בביצועים. במשימות של ידע כללי מולטימודלי המודל רושם ירידה קלה במדדים, ולכן עדיף להישאר עם הגרסה הקודמת.

איך מריצים

במשקל של 15 ג'יגה־בייט בדיוק bfloat16, תצטרכו כרטיס מסך בודד עם 24GB זיכרון כמו RTX 3090 או A10G כדי להריץ אותו בנוחות יחד עם פונקציית Flash Attention. יש בכרטיס גם דוגמת קוד לטעינה בכימות של 8 ביט דרך bitsandbytes, שתאפשר לדחוס אותו לכרטיסים צנועים יותר של 16GB זיכרון.

הריצה דורשת שימוש בפרמטר trust_remote_code בספריית transformers וגרסה 4.37.2 ומעלה, לצד קוד ייעודי לחיתוך התמונות ועיבוד הפריימים. אם אתם רק צריכים מענה מהיר לבדיקות ולא רוצים לנהל סקריפטים של חיתוך אריחים וזיכרון וידאו, יש להם דמו רשמי ב־Hugging Face.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL2_5-8B-MPO")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שנותן חופש כמעט מוחלט לשימוש מסחרי, שינוי הקוד והפצה של המודל בתוך מערכות סגורות. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית והסרת אחריות מהיוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗