GPT
I

InternVL3-8B

קוד פתוח

OpenGVLabapache-2.02025-04-10

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

מודל ראייה ושפה קומפקטי שמחבר מקודד תמונה לרכיב שפה של שבעה מיליארד פרמטרים. הוא מיועד למי שרוצה ניתוח תמונות, וידאו וממשקים בקוד פתוח מלא.

  • 7.9Bפרמטרים
  • 14.8 GBמשקל הקבצים
  • 102,663הורדות בחודש
  • 112לייקים

מה זה

הארכיטקטורה מחברת את InternViT בנפח של 300 מיליון פרמטרים ישירות לרכיב הטקסטואלי של Qwen2.5-7B דרך שכבת MLP פשוטה, תוך שימוש בדחיסת טוקנים ויזואליים לרבע מהגודל המקורי. השינוי המרכזי כאן לעומת דורות קודמים הוא אימון מקדים משולב, שבו הטקסט והתמונות נלמדים ביחד מההתחלה במקום לחבר רכיב ראייה למודל שפה שכבר עבר אימון נפרד.

הוא מנתח תמונות בודדות, רצפי תמונות, קטעי וידאו וממשקי משתמש גרפיים. במקום להסתפק ברזולוציה אחידה, המודל מחלק תמונות למקטעים של 448 על 448 פיקסלים כדי להתמודד עם פרטים קטנים, ומשתמש בקידוד מיקום גמיש שנועד לשפר הבנה של הקשרים ארוכים.

מתאים ל

  • ניתוח ממשקי משתמש

    זיהוי אלמנטים על המסך לפעולות אוטומציה וסוכני GUI בזכות אימון ייעודי לתחום.

  • חילוץ מידע ממסמכים וגרפים

    קריאת נתונים מתרשימים ומסמכים מורכבים בעזרת חלוקה למקטעים ברזולוציה דינמית.

  • הבנת וידאו ורצפי תמונות

    מענה על שאלות שמבוססות על מספר תמונות יחד בזכות תמיכה מובנית בריבוי קלטים.

איפה זה נופל

המודל דורש הרצת קוד מרוחק עם trust_remote_code שמוגדר כחיובי, מה שמחייב בדיקת אבטחה של הקוד לפני הטמעה. למרות שהכרטיס מציין תמיכה רחבה בשפות, אין נתונים ספציפיים על איכות העברית שלו, מה שמחייב בדיקה מעשית של יכולות ה־OCR והטקסט בעברית.

בנוסף, הכרטיס מודה במפורש בקיומו של פער בהסקה ובנטייה להזיות, עניין שניסו לצמצם באמצעות אופטימיזציית העדפות ייעודית. פונקציית עיבוד התמונה המקומית מגבילה את מספר החלוקות לעד 12 מקטעים, כך שתמונות ענקיות או מסמכים דחוסים מדי עלולים לאבד מידע קריטי.

אותה משפחה

InternVL3 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי?

כן, משקל המודל בפורמט bfloat16 דורש כ־16 גיגה בייט של זיכרון וידאו, מה שמאפשר להריץ אותו על כרטיס RTX 3090 או RTX 4090 של 24 גיגה בייט. עם קוונטיזציה ל־8 ביט צריכת הזיכרון יורדת עוד יותר, אך משימות עם תמונות רבות או וידאו ארוך יגדילו את הזיכרון הנדרש.

איך המודל מתמודד עם טקסט בעברית בתוך תמונות?

הכרטיס מגדיר את המודל כרב לשוני ומציג מבחני שפה כלליים, אך אין פירוט ספציפי או התחייבות לגבי איכות העברית. לפני שילוב שלו במערכת שקוראת מסמכים בעברית, חובה להריץ בדיקה עצמאית על דוגמאות מקומיות.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בגרסה 4.37.2 ומעלה, עם bfloat16 או בקוונטיזציה של 8 ביט דרך bitsandbytes. הקבצים שוקלים 14.8 גיגה בייט, כך שמשקל המודל עצמו נכנס לכרטיס מסך בודד של 24 גיגה בייט כמו RTX 3090 או RTX 4090.

אבל יש מלכוד משמעותי בהרצה עם מספר כרטיסים. הקוד בדף המודל דורש חלוקה ידנית מסורבלת של השכבות ומציין דרישה לכרטיסי 80 גיגה בייט בריבוי מעבדים, יחד עם פונקציית עיבוד תמונה מותאמת אישית שצריך להטמיע בקוד שלכם. אם אין לכם שרת ייעודי וסבלנות לתחזק קוד עיבוד מקומי, עדיף להשתמש בנקודת קצה מנוהלת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL3-8B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 סטנדרטי ופתוח לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והרישיון המקורי בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗