GPT
I

InternVL2_5-1B

קוד פתוח

OpenGVLabmit2024-11-20

  • transformers
  • tensorboard
  • safetensors
  • internvl_chat
  • feature-extraction

מודל ראייה ושפה קומפקטי במיוחד, שמשלב עיבוד תמונה עם מודל טקסט של חצי מיליארד פרמטרים. מתאים למי שחייב להריץ מולטימודל מקומית על חומרה חלשה בלי לשלם על שרתים יקרים.

  • 938Mפרמטרים
  • 1.8 GBמשקל הקבצים
  • 4,448הורדות בחודש
  • 69לייקים

מה זה

מדובר בגרסה הקטנה ביותר בסדרת InternVL 2.5, עם כ־938 מיליון פרמטרים בלבד. הוא מחבר בין רכיב ראייה מסוג InternViT של 300 מיליון פרמטרים לבין מודל שפה Qwen2.5-0.5B-Instruct באמצעות שכבת MLP. המבנה הזה מחלק תמונות למקטעים של 448 על 448 פיקסלים כדי לשמר פרטים קטנים, ותומך בקלט של תמונות בודדות, מספר תמונות במקביל ואפילו סרטוני וידאו שמחולקים לפריימים.

הייחוד כאן הוא ביצועים מולטימודליים בחבילה של 1.8 גיגה בייט בלבד. רוב המודלים שמתמודדים עם ניתוח מסמכים או תמונות מתחילים מ־7 מיליארד פרמטרים, בעוד שכאן מקבלים יכולת סבירה לקריאת טקסט מתמונה והבנת הקשר חזותי במכשיר קצה, תוך שמירה על עמידות מול תמונות דחוסות ואיכות ירודה בזכות אוגמנטציית JPEG בתהליך האימון.

מתאים ל

  • זיהוי טקסט במכשירי קצה

    קריאת שלטים, קבלות או מסמכים ישירות על חומרה מקומית וזולה בלי תלות ברשת.

  • סינון ראשוני למאגרי תמונות

    תיוג מהיר ומיון של אלפי תמונות על גבי שרת יחיד בעלות עיבוד אפסית.

  • ניתוח תנועה בווידאו מקומי

    מענה על שאלות לגבי רצף פריימים ממצלמות אבטחה בלי להעלות את הווידאו לענן.

איפה זה נופל

החולשה העיקרית מגיעה ממודל השפה שבבסיסו, שמכיל 500 מיליון פרמטרים בלבד. כושר ההסקה שלו מוגבל מאוד, ורמת ההזיות שלו תהיה גבוהה בהשוואה לדגמים הגדולים יותר בסדרה כמו ה־8B או ה־78B. המפתחים מציינים במפורש כי אימון מולטימודלי פוגע ביכולות השפה הטהורות, ובמודל קטן כל כך, שיחות ארוכות או שאלות שדורשות שרשרת חשיבה עלולות להוביל לחזרתיות ולתשובות שגויות. בנוסף, חובה לוודא מראש תמיכה בעברית מורכבת בתמונות, שכן ליבת הטקסט נוטה בעיקר לאנגלית ולסינית.

אותה משפחה

InternVL2-5 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יצליח לקרוא מסמכים סרוקים ברזולוציה גבוהה?

כן, הוא משתמש בשיטה שמפרקת את התמונה למשבצות של 448 פיקסלים ולכן הוא לא מורח את התמונה לגודל אחיד. עם זאת, היכולת שלו לפענח שדות מסובכים או טבלאות מורכבות נמוכה מזו של מודלים גדולים.

אפשר להריץ אותו על מעבד רגיל בלי כרטיס מסך של אנבידיה?

טכנית כן, הקבצים שוקלים פחות מ־2 גיגה בייט והוא יעלה לזיכרון ה־RAM בקלות. בפועל, החלוקה של תמונות למקטעים רבים יוצרת הרבה טוקנים ויזואליים, ולכן על מעבד בלבד המענה יהיה אטי למדי.

איך מריצים

טוענים אותו ישירות דרך transformers של פייתון, אך חובה להשתמש בגרסה 4.37.2 ומעלה ולהפעיל trust_remote_code מפני שהוא רץ על ארכיטקטורה מותאמת. המודל שוקל 1.8 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך פשוט עם 4 עד 6 גיגה זיכרון יריץ אותו בקלות, ועם קוונטיזציה של 8 ביט דרך bitsandbytes אפשר לרדת אף פחות מזה.

אם אתם צריכים ניתוח של מסמכים ארוכים בעברית או משימות שדורשות היגיון מורכב, עדיף לפנות ל־API של מודל ענן גדול. המודל הזה שווה את זה רק כשאתם חייבים עיבוד מקומי זול, אופליין, או שמירה קפדנית על פרטיות בלי להוציא נתונים החוצה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL2_5-1B")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון MIT, מה שנותן לכם חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו בתוכנה סגורה ולהפיץ אותו ללקוחות, כל עוד משאירים את הצהרת זכויות היוצרים המקורית בתוך הקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗