GPT
I

InternVL3_5-8B

קוד פתוח

OpenGVLabapache-2.02025-08-25

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

מודל מולטימודלי פתוח שמביא יכולות ראייה והסקה מתקדמות למשקל סביר של שמונה מיליארד פרמטרים. הוא מיועד למי שרוצה עיבוד תמונה וטקסט מקומי בלי להחזיק שרתי ענק.

  • 8.5Bפרמטרים
  • 15.9 GBמשקל הקבצים
  • 47,929הורדות בחודש
  • 102לייקים

מה זה

הארכיטקטורה מחברת מודל ראייה של שלוש מאות מיליון פרמטרים למודל שפה של שמונה נקודה שניים מיליארד פרמטרים. השילוב הזה נשען על חלוקת תמונה לחלקים, דחיסה שלהם למספר מצומצם של טוקנים ויזואליים, והזנה ישירה לשכבות השפה. האימון כולל שלב ייחודי של למידת חיזוק בשני צעדים, אופליין ואונליין, שנועד לחדד פתרון בעיות במתמטיקה והבנת תרשימים.

בגרסה הזו הוכנסו גם יכולות של הבנת ממשקי משתמש ופעולה בסביבות מבוססות סוכן. המפתחים מדווחים על שיפור של עד שישה עשר אחוז בביצועי הסקה לעומת הדור הקודם, לצד האצה של פי ארבעה במהירות ההסקה הודות לאופטימיזציות בעיבוד הטוקנים הוויזואליים. בפועל, המודל מסוגל לנתח צילומי מסך, לקרוא מסמכים סרוקים מורכבים ולעקוב אחרי הוראות חשיבה מפורטות בעזרת הנחיית מערכת ייעודית.

מתאים ל

  • ניתוח ממשקי משתמש

    זיהוי כפתורים וטפסים בצילומי מסך לטובת אוטומציה ובדיקות תוכנה.

  • חילוץ מידע ממסמכים

    קריאת טבלאות ותרשימים גרפיים ותרגום המידע הוויזואלי למבנה נתונים.

  • הסקה מתמטית רב־שלבית

    פתרון שאלות מדעיות וגרפים מורכבים בעזרת מצב החשיבה המובנה.

איפה זה נופל

במצב חשיבה מורכב המודל נוטה לחזרתיות בלולאות טקסט, ולכן המפתחים מחייבים הגדרת טמפרטורה של אפס נקודה שש ודגימה אקטיבית כדי לייצב את הפלט. בנוסף, חלון ההקשר מוגבל לשלושים ושניים אלף טוקנים, ותמונות מורכבות תופסות נתח נכבד מהתקציב הזה. אין כאן נתונים מפורטים על איכות הפלט בעברית או על רמת הדיוק בטקסטים מקומיים, כך שחובה לבדוק אותו על מסמכים אמיתיים בעברית לפני שילוב במערכת פעילה.

אותה משפחה

InternVL3-5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

מה ההבדל בין הגרסה הזו לגרסת ה־Flash?

גרסת הפלאש כוללת ניתוב חכם שמכווץ אזורים פשוטים בתמונה לחמישים אחוז פחות טוקנים. הגרסה הנוכחית משתמשת בדחיסה קבועה של מאתיים חמישים ושישה טוקנים לכל מקטע תמונה.

איך מפעילים את מצב החשיבה המעמיק?

צריך להגדיר בפרומפט המערכת את ההנחיה הייעודית של R1, ולהריץ את הדגימה עם טמפרטורה של אפס נקודה שש כדי למנוע חזרות מיותרות.

איך מריצים

המשקלים תופסים כמעט שישה עשר גיגה בייט בפורמט ביפלואוט 16 ומחולקים לעשרים וארבעה קבצים. כדי לטעון אותו במלואו יחד עם הקשר של שלושים ושניים אלף טוקנים ועיבוד תמונה ברזולוציה גבוהה, צריך כרטיס גרפי עם זיכרון וידאו משמעותי, או לחלופין שימוש בקוונטיזציה והורדת הדיוק.

ההרצה מתבצעת דרך ספריית הטרנספורמרס המוכרת. שימו לב שהגרסה הזו מגיעה בפורמט המותאם למאגר הגיטהאב של הפרויקט, וכדי לעבוד בתקן הרגיל של האגינג פייס יש להשתמש בסקריפט ההמרה שהם מצרפים או להוריד מראש את גרסת ה־HF המקבילה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL3_5-8B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בחינם או בתשלום, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗