GPT
I

InternVL3_5-38B

קוד פתוח

OpenGVLabapache-2.02025-08-25

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

מודל מולטימודלי פתוח עם שילוב בין מפענח תמונה כבד לשפת מודל גדולה. הוא מיועד למי שצריך יכולות הסקת מסקנות חזקות מטקסט ותמונה בלי להסתמך על שירותים סגורים.

  • 38Bפרמטרים
  • 71.5 GBמשקל הקבצים
  • 20,168הורדות בחודש
  • 46לייקים

מה זה

מדובר במודל שמחבר אנקודר תמונה של 5.5 מיליארד פרמטרים עם מודל שפה של 32.8 מיליארד פרמטרים, מה שמביא אותו לסך כולל של 38.4 מיליארד פרמטרים. המבנה הזה נותן דגש משמעותי לעיבוד הוויזואלי לעומת דגמים קטנים יותר בסדרה שמשתמשים במפענח של 0.3 מיליארד פרמטרים בלבד. הוא יודע לקבל קלט משולב של תמונה וטקסט, לפענח אותו, ולענות ברמת פירוט גבוהה כולל מצב חשיבה מעמיק.

האימון עבר ארבעה שלבים, כולל אימון מקדים רציף, כוונון עדין עם חלון הקשר של 32K טוקנים, ולמידת חיזוק בשני שלבים שמשלבת אופטימיזציה מקוונת ולא מקוונת. התהליך הזה נועד לשפר מטלות חשיבה מורכבות במתמטיקה ובמדעים, לצד הרחבה למשימות כמו אינטראקציה עם ממשקי משתמש גרפיים.

מתאים ל

  • ניתוח מסמכים ותרשימים

    מפענח הראייה הגדול מאפשר קריאה מדויקת של פרטים גרפיים ומשוואות מורכבות.

  • הפעלת סוכנים על ממשקי GUI

    המודל כולל אימון ייעודי להבנת ממשקים גרפיים וביצוע פעולות על גבי מסכים.

  • פתרון בעיות מתמטיות מתמונה

    שילוב מצב החשיבה מייצר תהליך הסקת מסקנות מפורט צעד אחר צעד.

איפה זה נופל

בגלל גודלו והמבנה הלא דחוס, המודל הזה דורש 256 טוקנים לכל פיסת תמונה, בניגוד לגרסאות פלאש שמכווצות ל־64 טוקנים, מה שיוצר צוואר בקבוק של עיבוד וזיכרון בעבודה עם תמונות ברזולוציה גבוהה. הפעלת מצב החשיבה דורשת הגדרת פרומפט מערכת ייעודי ופרמטר דגימה כדי למנוע חזרתיות מיותרת בתשובות, והוא אינו מותאם לזמני תגובה מיידיים.

אותה משפחה

InternVL3-5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

באיזו גרסה כדאי לבחור מתוך הרשימה?

הגרסה הזו ללא סיומת נוספת עברה את כל צינור האימון כולל שלבי למידת החיזוק, והיא המומלצת ביותר לשימוש כללי. שאר הגרסאות נועדו בעיקר למחקר ובדיקת שלבי ביניים.

איך מפעילים את מצב החשיבה המעמיק?

צריך להגדיר פרומפט מערכת ייעודי בשם R1_SYSTEM_PROMPT. היוצרים ממליצים להפעיל דגימה עם טמפרטורה של 0.6 כדי לקבל תוצאות טובות ולמנוע לולאות של טקסט חוזר.

איך מריצים

המשקל של הקבצים מגיע ל־71.5 ג'יגה בייט בפורמט bfloat16, ומחולק בין 36 קבצים. כדי לטעון אותו כמו שהוא צריך מערך של מספר כרטיסים גרפיים חזקים עם זיכרון משותף גבוה, במיוחד אם רוצים לנצל את חלון ההקשר המלא של 32K טוקנים או להפעיל את מצב הפירוק של הראייה והשפה על כרטיסים נפרדים.

הגרסה הזו מגיעה בפורמט הרגיל של הקבוצה בגיטהאב, ויש גם גרסה מקבילה שמותאמת לתקן של ספריית transformers הרגילה. אם אין לכם תשתית שרתים מקומית שמסוגלת להחזיק משקל כזה בזיכרון, פנייה לפתרון אירוח חיצוני תהיה זולה ופשוטה בהרבה מהרמה של שרת ייעודי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL3_5-38B")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗