GPT
I

InternVL3_5-241B-A28B

קוד פתוח

OpenGVLabapache-2.02025-08-25

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

זה מודל ראייה ושפה ענק של 241 מיליארד פרמטרים עם 28 מיליארד מופעלים. הוא מיועד למי שחייב מודל קוד פתוח עם ביצועי חשיבה וניתוח תמונה ברמה הכי גבוהה שיש היום.

  • 241Bפרמטרים
  • 448 GBמשקל הקבצים
  • 3,146הורדות בחודש
  • 140לייקים

מה זה

מדובר במודל הדגל בסדרת InternVL3.5, שמשלב מודל שפה עם מפענח ראייה של 5.5 מיליארד פרמטרים. בארכיטקטורת התערובת הזו רק 28 מיליארד פרמטרים פעילים בכל טוקן, מה שמקצר את זמן הריצה לעומת מודלים צפופים בגודל דומה. המודל עבר אימון מתמשך, כוונון להוראות וחיזוק בשני שלבים שנועד לייצב תהליכי חשיבה ארוכים.

במבחני ביצועים של פתרון בעיות מתמטיות, קריאת גרפים, הבנת וידאו ומשימות ממשק משתמש, המפתחים מציגים זינוק של עד 16 אחוז לעומת הדור הקודם. המשמעות בפועל היא יכולת גבוהה משמעותית לפרק תרשימים טכניים מסובכים, לבצע הסקת מסקנות רב שלבית מתמונות ולעקוב אחרי הוראות מורכבות.

מתאים ל

  • פענוח תרשימים ודוחות

    הוא מצטיין בחילוץ מידע והסקה רב שלבית מתוך גרפים, שרטוטים הנדסיים ומסמכים סרוקים מורכבים.

  • סוכני ממשק משתמש

    הוא אומן ייעודית על פעולות GUI ויכול לזהות אלמנטים במסך ולתכנן רצף פעולות לביצוע.

  • פתרון בעיות מדעיות מתמונה

    השילוב של ראייה ומצב חשיבה מבוסס RL מאפשר לו לפתור משוואות וחידות היגיון שמוצגות חזותית.

איפה זה נופל

החיסרון המרכזי הוא צוואר הבקבוק הלוגיסטי. משקל של כמעט חצי טרה בייט ב־141 קבצים דורש תשתית אחסון מהירה ותקשורת חזקה בין המעבדים הגרפיים, אחרת השיהוי יהיה בלתי נסבל. כדי להפעיל את מצב החשיבה המלא צריך להגדיר פרומפט מערכת ייעודי בשם R1_SYSTEM_PROMPT ודגימה בטמפרטורה 0.6, ובלי זה המודל לא מנצל את יכולות ההסקה שפורסמו. מעבר לכך, הכרטיס אינו מפרט נתונים לגבי תמיכה ישירה בעברית, ולכן חובה לבדוק פענוח טקסט עברי מתמונות לפני שמסתמכים עליו.

אותה משפחה

InternVL3-5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להריץ את גרסת ה־Instruct במקום הגרסה הרגילה?

עדיף להשתמש בגרסה הרגילה ללא סיומת. המפתחים מציינים במפורש שהיא הגרסה הסופית שעברה את כל צינור האימון כולל שלב הלמידה מחיזוקים, בעוד שגרסאות המקור וה־Instruct נועדו בעיקר לצורכי מחקר.

איך מפעילים את יכולת החשיבה העמוקה של המודל?

צריך להגדיר את פרומפט המערכת הייעודי של R1 כפי שמוגדר במאגר של VLMEvalKit. המפתחים ממליצים להפעיל דגימה עם ערך טמפרטורה של 0.6 כדי למנוע חזרתיות מיותרת בתשובות ארוכות.

איך מריצים

כדי להריץ אותו מקומית צריך מערך חומרה כבד מאוד. המשקלים לבדם שוקלים 448 גיגה בייט בפורמט bfloat16, כך שצריך לפחות 500 עד 600 גיגה בייט זיכרון וידאו רק כדי לטעון אותם לפני זיכרון הקשר, כלומר קלאסטר של שמונה כרטיסי A100 או H100 של 80 גיגה בייט.

המפתח פרסם שתי גרסאות, גרסת גיטהאב רגילה וגרסה תואמת רשמית לטרנספורמרס. יש גם שלבי ביניים כמו Pretrained או Instruct, אבל אם המטרה היא שימוש מוכן לעבודה צריך את המשקל המלא שעבר CascadeRL. למי שאין שרת ייעודי כזה פנוי בארגון, פנייה לשירות ענן או API שמארח אותו תהיה הבחירה ההגיונית היחידה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL3_5-241B-A28B")
print(pipe("שלום"))

הקבצים

141 קבצים במאגר, 448 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המודל והפצה שלו בתוך מוצרים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗