GPT
I

InternVL2-2B

קוד פתוח

OpenGVLabmit2024-06-27

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

מודל ראייה ושפה קומפקטי במיוחד שמנתח תמונות ווידאו ישירות על חומרה ביתית. הוא מציע יכולות פענוח מסמכים וטקסט בתמונה שמקובל למצוא רק במודלים כבדים בהרבה.

  • 2.2Bפרמטרים
  • 4.1 GBמשקל הקבצים
  • 570,706הורדות בחודש
  • 81לייקים

מה זה

מדובר במודל מולטימודלי שמשלב רכיב ראייה מסוג InternViT של 300 מיליון פרמטרים יחד עם מודל השפה internlm2-chat-1_8b דרך שכבת קישור של MLP. הוא קולט טקסט, תמונות בודדות או מרובות וסרטוני וידאו, ותומך בחלון הקשר של 8k טוקנים. השיטה שבה הוא חותך ומעבד תמונות ברזולוציה דינמית מאפשרת לו לחלץ פרטים עדינים בלי לכווץ את כל המידע לרזולוציה אחידה ונמוכה.

במבחני ביצועים מול מתחרים באותו סדר גודל כמו PaliGemma של 2.9 מיליארד פרמטרים, הוא מציג יתרון מובהק במשימות מבוססות טקסט ויזואלי. במבחן OCRBench הוא מגיע לציון של 784 לעומת 614 של המתחרה, ובמבחן MathVista להבנה גרפית ומתמטית הוא רושם 46.3 נקודות לעומת 28.7. המשמעות בפועל היא שהוא מדויק יותר בקריאת נתונים מגרפים, טבלאות ומסמכים סרוקים, ולא רק בזיהוי כללי של עצמים בתמונה.

מתאים ל

  • חילוץ מידע ממסמכים וקבלות

    התוצאה הגבוהה במבחן DocVQA של 86.9 נקודות הופכת אותו לפתרון קל וזול לפענוח נתונים מתוך טפסים סרוקים.

  • ניתוח גרפים ותרשימים

    הוא השיג 76.2 נקודות במבחן ChartQA, ולכן מתאים למעקב אוטומטי אחר דוחות ויזואליים על מחשב מקומי.

  • איתור עצמים לפי טקסט

    הוא מחזיר קואורדינטות של תיחום לפי תיאור מילולי בתוך התמונה, בלי להזדקק למודל ייעודי נפרד.

איפה זה נופל

יוצרי המודל מציינים בפירוש שבגלל גודלו המצומצם והאופי ההסתברותי של המערכת, הוא נוטה לייצר פלטים בלתי צפויים, הטיות ותכנים פוגעניים. מעבר לאזהרות הבטיחות, מודל שפה של 1.8 מיליארד פרמטרים סובל מהזיות בהסברים ארוכים ומתקשה בהיגיון מורכב. במבחני הבנה מתקדמים כמו MMMU הציון שלו עומד על 36.3 נקודות בלבד, מה שמלמד שהוא לא מתאים לשאלות שמצריכות ידע תיאורטי עמוק או הסקת מסקנות רב שלבית.

אותה משפחה

InternVL2 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה עם סרטוני וידאו?

כן, הקוד והאימון שלו תומכים בקבלת פריימים מרובים. במבחן MVBench על חילוץ של 16 פריימים מתוך וידאו הוא רשם ציון של 60.2 נקודות, כך שניתן להזין לו קטעי וידאו קצרים לפענוח פעולות והבנת תוכן.

כמה זיכרון כרטיס מסך נדרש כדי לעבוד איתו?

במשקל מלא של bfloat16 הקבצים תופסים כ־4.1 גיגה בייט, ולכן כרטיס עם 8 גיגה זיכרון יספיק לרוב השאילתות. במידה ומפעילים כימות ל־4 ביט לפי הקוד הרשמי, אפשר להריץ אותו גם על כרטיסים צנועים של 4 עד 6 גיגה זיכרון.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.1 גיגה בייט בדיוק bfloat16, כך שכרטיס מסך פשוט עם 6 עד 8 גיגה זיכרון יחזיק אותו בקלות. אם משתמשים בכימות ל־4 ביט או 8 ביט דרך bitsandbytes לפי הדוגמאות של הפרויקט, אפשר לדחוף אותו גם לחומרה מוגבלת עוד יותר. הריצה מתבצעת ישירות דרך ספריית transformers עם trust_remote_code מופעל, והקוד דורש עיבוד מוקדם של התמונות לפטצ'ים בגודל 448 על 448 פיקסלים.

אם אתם צריכים רק תיוג תמונות מזדמן בענן ולא מחזיקים שרת GPU דולק, עדיף לפנות ל־API מסחרי כדי לא לשלם על תחזוקת שרת סרק. הריצה העצמית שווה את זה ברגע שאתם צריכים פרטיות מלאה לקבצים, לטנטיות מקומית קבועה, או עיבוד רציף של כמויות גדולות שלא משתלם לתמחר לפי קריאה בודדת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL2-2B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו בתוך מוצר סגור ולהפיץ אותו חופשי, כשהתנאי היחיד הוא שמירה על הצהרת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗