GPT
I

InternVL2-8B

קוד פתוח

OpenGVLabmit2024-06-27

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

זה מודל ראייה ושפה קומפקטי שמספק ביצועים חזקים מאוד בקריאת מסמכים וטבלאות, ומתאים למי שחייב לעבד תמונות ווידאו מקומית בלי לשלם על מודל ענק.

  • 8.1Bפרמטרים
  • 15.0 GBמשקל הקבצים
  • 27,193הורדות בחודש
  • 186לייקים

מה זה

הארכיטקטורה מחברת מודל ראייה קטן יחסית של 300 מיליון פרמטרים לרכיב שפה internlm2_5-7b-chat דרך שכבת קישור. החלוקה הזו משאירה את רוב החישובים לחלק הטקסטואלי, מה שעוזר לו להבין תמונות מורכבות בלי להעמיס על זיכרון העיבוד הגרפי.

במבחני מסמכים ותרשימים כמו DocVQA ו־InfoVQA הוא מגיע לציונים של 91.6 ו־74.8, תוצאות שעוקפות מודלים פתוחים כבדים בהרבה מאותו דור. המשמעות היא שקריאת טקסט מתוך תמונה, הבנת דיאגרמות ותרגום נתונים חזותיים מתבצעים בדיוק גבוה יחסית לגודל שלו.

הוא מתוכנן לעבוד עם הקשר של 8k טוקנים, תומך במספר תמונות במקביל ואפילו בווידאו על ידי פירוק לפריימים, כשהקלט החזותי נחתך למקטעים דינמיים ברזולוציה מקורית.

מתאים ל

  • חילוץ נתונים מדוחות וטפסים

    התוצאות הגבוהות ב־DocVQA הופכות אותו לבחירה טבעית לשליפת ערכים מתוך מסמכים וקבלות ישירות לפורמט טקסט.

  • ניתוח גרפים ותרשימים

    עם ציון 83.3 ב־ChartQA הוא מסוגל לקרוא תוויות ומגמות מתוך צילומי מסך של דוחות עסקיים.

  • תחקור רצף תמונות ווידאו

    הארכיטקטורה תומכת בקבלת מספר תמונות בשיחה אחת, מה שמאפשר להשוות בין קלטים או לנתח פריימים מסרטון.

איפה זה נופל

היוצרים מציינים במפורש שהמודל עלול לייצר הטיות ותכנים פוגעניים עקב האופי ההסתברותי שלו וממדי הרשת. בנוסף, במשימות איתור מיקום חזותי וציון קואורדינטות הוא מקבל 82.9 בממוצע, ציון נמוך יותר מגרסאות ה־26B וה־40B, כך שלא כדאי להסתמך עליו לחיתוך גבולות מדויק. מבחינת שפה, הדגש המרכזי באימון הוא סינית ואנגלית, מה שאומר שהבנת עברית בתמונות ובטקסט צפויה להיות מוגבלת מאוד ודורשת בדיקה קפדנית מראש.

אותה משפחה

InternVL2 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יצליח לקרוא מסמכים בעברית?

הכרטיס מדגיש יכולות רב-לשוניות אך המודל מבוסס על InternLM שאומן בעיקר על אנגלית וסינית. סביר להניח שהבנת עברית מורכבת בתמונות תהיה חלשה עד לא קיימת, ולכן חובה להריץ בדיקת היתכנות על דוגמאות שלכם לפני החלטה.

כמה זיכרון וידאו דרוש בפועל לעיבוד תמונות ברזולוציה גבוהה?

במצב bfloat16 רגיל צריך לפחות 24GB VRAM, מכיוון שהתמונות נחתכות למספר מקטעים של 448 על 448 פיקסלים שמנפחים את כמות הטוקנים. אם רוצים להסתפק בכרטיס של 16GB, יש להשתמש בכימות של 8 ביט כפי שמוצג בקוד ההרצה.

איך מריצים

כדי להריץ אותו במשקל המקורי של bfloat16 תצטרכו כרטיס מסך בודד עם 24GB של VRAM, כמו RTX 3090 או RTX 4090, שכן המודל שוקל כ־15GB לפני זיכרון הפעלה ותמונות. הטעינה דורשת trust_remote_code=True וספריית transformers עדכנית, רצוי עם Flash Attention פעיל.

אם הזיכרון מוגבל, הדוקומנטציה מציגה אפשרות לטעון אותו בכימות של 8 ביט דרך bitsandbytes, מה שמוריד את דרישות החומרה ומאפשר עבודה על כרטיסים צנועים יותר של 16GB. אם אתם צריכים תפוקה גדולה עם חביון אפסי ובלי להתעסק בניהול קבצי משקלים, שירותי ענן עם API מוכן יחסכו את כאב הראש.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL2-8B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT. הרישיון מאפשר שימוש מסחרי, שינוי קוד, הפצה וסגירת קוד ללא תשלום תמלוגים, כשהדרישה היחידה היא שמירת הודעת זכויות היוצרים המקורית והסרת אחריות מהמפתחים. מתאים לחלוטין להטמעה במוצר סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗