GPT
I

InternVL3-14B

קוד פתוח

OpenGVLabapache-2.02025-04-10

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

מודל מולטימודלי בגודל 15 מיליארד פרמטרים שמחבר רכיב ראייה עם בסיס שפה חזק. הוא מתאים למי שרוצה ניתוח תמונות, מסמכים ווידאו מקומית בלי תלות בשירותי ענן סגורים.

  • 15Bפרמטרים
  • 28.2 GBמשקל הקבצים
  • 12,515הורדות בחודש
  • 79לייקים

מה זה

המודל משלב מודל ראייה בשם InternViT-300M עם מודל השפה Qwen2.5-14B דרך שכבת קישור ייעודית. במקום לאמן מודל טקסט ורק אז להדביק לו עיניים, המפתחים השתמשו באימון מקדים שמשלב טקסט ותמונות יחד באותו שלב, מה שמשמר ביצועים גבוהים גם בטקסט נקי בלי לפגוע בהבנה הוויזואלית.

בגרסה הזו הוכנס מנגנון קידוד מיקום ויזואלי גמיש יותר בשם V2PE, שמשפר את הטיפול בהקשרים ארוכים ובריבוי תמונות. המודל תומך בחיתוך דינמי של תמונות ברזולוציות שונות ומשתמש בטכניקת אופטימיזציה מבוססת העדפות כדי לצמצם שגיאות בשרשראות חשיבה מורכבות.

מתאים ל

  • ניתוח מסמכים ותרשימים

    הארכיטקטורה מחלקת תמונות לאריחים ברורים, מה שמאפשר לחלץ נתונים מדוחות מורכבים וגרפים.

  • השוואה בין תמונות

    המודל תומך בריבוי תמונות בשיחה אחת ומסוגל להצביע על הבדלים ביניהן או לחבר מידע מכמה מקורות.

  • סוכני ממשק משתמש

    אימון המודל הורחב לזיהוי רכיבים במסכים ובממשקים גרפיים לצורך הבנת פעולות משתמש.

איפה זה נופל

ההפעלה של המודל דורשת הרצת קוד מותאם אישית מהמאגר בעזרת trust_remote_code, מה שמחייב זהירות ובדיקת אבטחה בסביבות ייצור. בנוסף, עיבוד של תמונות ברזולוציה גבוהה חותך אותן לחלקים של 448 על 448 פיקסלים, מה שמייצר כמות גדולה מאוד של טוקנים ויזואליים ומאט משמעותית את זמן התגובה. החומר לא כולל מדדי דיוק ספציפיים בעברית, ולכן חובה לבדוק את איכות הפענוח והתשובות בשפה המקומית לפני שמסתמכים עליו.

אותה משפחה

InternVL3 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב אישי עם כרטיס מסך ביתי יחיד?

לא בגרסה הרגילה שלו. מודל של 15 מיליארד פרמטרים ששוקל מעל 28 גיגה בייט ידרוש זיכרון וידאו שחורג מרוב הכרטיסים הצרכניים, אלא אם תשתמשו בקוונטיזציה כבדה מאוד שעדיין תדרוש משאבים משמעותיים.

במה הוא שונה מגרסאות InternVL הקודמות?

הוא עבר אימון מקדים משולב של תמונה וטקסט יחד מההתחלה, קיבל קידוד מיקום חדש להקשרים ארוכים, והבסיס הלשוני שלו נשען על סדרת Qwen2.5.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־28.2 גיגה בייט בדיוק bfloat16. להרצה מלאה בפורמט המקורי בלי קוונטיזציה נדרש מערך כרטיסי מסך רציני, כאשר דוגמת הקוד של המפתחים עצמם מציינת צורך במספר כרטיסי 80GB לחלוקת שכבות נכונה.

אפשר לכווץ את המודל ל־8 ביט באמצעות ספריית bitsandbytes כדי לחסוך זיכרון. אם אין לכם שרת ייעודי בענן או תחנת עבודה מרובת מאיצים, כנראה שעדיף לשקול מודל קטן יותר בסדרה כמו גרסאות ה־2B או ה־8B, או לחכות לזמינות שלו דרך ספקי API חיצוניים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL3-14B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, לשלב אותו בתוך מוצרים ולהפיץ אותו חופשי, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗