GPT
I

InternVL2-26B

קוד פתוח

OpenGVLabmit2024-06-27

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

מודל ראייה ושפה שמציג יכולות פענוח מסמכים וגרפים שעוקפות מודלים מסחריים סגורים. הוא מתאים למי שחייב מודל פתוח וחזק לעיבוד תמונות ווידאו ולא רוצה לשלוח מידע החוצה.

  • 26Bפרמטרים
  • 47.5 GBמשקל הקבצים
  • 177,031הורדות בחודש
  • 118לייקים

מה זה

הארכיטקטורה מחברת בין מודל ראייה של שישה מיליארד פרמטרים, מקשר מסוג מתאם רשת, ומודל שפה של עשרים מיליארד פרמטרים. השילוב הזה נותן כוח חישובי שמתמקד בניתוח ויזואלי עמוק לצד הפקת טקסט, עם חלון הקשר של שמונת אלפים טוקנים ותמיכה בריבוי תמונות וסרטוני וידאו.

במבחני ביצועים על מסמכים ותרשימים הוא עוקף מערכות מובילות. בבדיקת הבנת מסמכים הוא מגיע לציון 92.9 מול 87.2 של מתחרים מסחריים, ובניתוח גרפים הוא מוביל עם 84.9 לעומת 78.1. זה אומר שבמקום לנחש ערכים מקורבים בטבלאות צפופות או בקבצים סרוקים, הוא מחלץ נתונים קריאים בדיוק גבוה בהרבה ממה שהורגלנו במודלים פתוחים.

מתאים ל

  • חילוץ מידע מדוחות

    הוא משיג 92.9 במבחן דוקומנטים ויודע לחלץ מספרים מטבלאות ומסמכים סרוקים ברמת דיוק גבוהה במיוחד.

  • ניתוח תרשימים וגרפים

    במבחן ניתוח תרשימים הוא עוקף מתחרים מסחריים ומזהה מגמות ונתונים מדויקים בתוך אינפוגרפיקה.

  • תחקור קטעי וידאו

    הוא מעבד 16 פריימים ברצף ומסוגל להשוות בין קטעים ולענות על שאלות לגבי תוכן הווידאו.

  • איתור אזורים בתמונה

    הוא מקבל תיאור טקסטואלי ומחזיר תיחום מדויק של האובייקט לפי קואורדינטות בתוך הקובץ.

איפה זה נופל

היוצרים מודים בפירוש שהמודל עלול לפלוט הטיות, אפליה או תוכן פוגעני עקב אופיו ההסתברותי וגודלו, כך שחובה להוסיף שכבת סינון לפני חשיפה ללקוחות. בנוסף, חלון ההקשר עומד על שמונת אלפים טוקנים בלבד, מה שמגביל סרטוני וידאו ארוכים או מסמכים עתירי עמודים. קיימת גם בעיית הזיות בתמונות מורכבות, כפי שמשתקף בציון של 50.7 במבחן בדיקת הזיות.

אותה משפחה

InternVL2 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב אישי רגיל?

לא. המודל שוקל מעל 47 גיגה בפורמט המקורי ודורש לפחות כרטיס מקצועי של 80 גיגה זיכרון גרפי או מערך של מספר כרטיסים. גם בקוונטיזציה של שמונה ביט תצטרכו חומרה חזקה בהרבה ממה שקיים במחשבים ביתיים.

איך המודל מסתדר עם תמונות ברזולוציה גבוהה?

הקוד שלו כולל שלב חיתוך דינמי שמפרק תמונה גדולה למספר מקטעים קטנים ומנתח אותם במקביל. זה מאפשר לקרוא טקסט זעיר במסמכים, אבל מגדיל באופן חד את כמות הטוקנים ואת ניצול הזיכרון בכל שאילתה.

מה נדרש מבחינת קוד כדי להפעיל אותו?

צריך להשתמש בספריית שנאים מגרסה 4.37.2 ומעלה ולהפעיל אפשרות של הרצת קוד מרוחק. בנוסף, חובה לכלול בפרויקט את פונקציות העיבוד המקדים של התמונה שמפורטות במדריך כדי להזין את הקלטים בצורה תקינה.

איך מריצים

כדי להריץ אותו במשקל המקורי צריך כרטיס גרפי בודד של שמונים גיגה זיכרון כמו כרטיס מקצועי מהיר, או חלוקה בין מספר כרטיסים קטנים יותר, אחרת המערכת תקרוס מחוסר מקום. החבילה שוקלת 47.5 גיגה ומחולבת ל־34 קבצים, מה שדורש הורדה כבדה והקצאת זיכרון מתאימה עוד לפני הטעינה.

אפשר לכווץ אותו לשמונה ביט כדי לחסוך מקום, אבל מנגנון עיבוד התמונה מחלק כל קלט לכמה חיתוכים דינמיים שמעמיסים מאוד על הזיכרון. אם אין לכם גישה לשרתים חזקים או שאתם מריצים שאילתות בודדות בלבד, החזקת תשתית כזו תהיה יקרה ולא משתלמת בהשוואה לקריאת רשת למודל מנוהל.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL2-26B")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון אם־אי־טי חופשי. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗