GPT
I

InternVL3_5-GPT-OSS-20B-A4B-Preview

קוד פתוח

OpenGVLabapache-2.02025-08-25

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

זה מודל ראייה ושפה מבוסס תערובת מומחים שמשלב אנקודר תמונה קל עם בסיס שפה של 21 מיליארד פרמטרים. הוא מיועד למי שצריך הסקת מסקנות מתקדמת מתמונות בלי להריץ מודלי ענק של מאות מיליארדים.

  • 392Mפרמטרים
  • 39.6 GBמשקל הקבצים
  • 18,389הורדות בחודש
  • 85לייקים

מה זה

הארכיטקטורה מחברת בין אנקודר תמונה מסוג InternViT בגודל 300 מיליון פרמטרים לבין מודל שפה של 20.9 מיליארד פרמטרים שמבוסס על GPT-OSS, כאשר בסך הכול יש כאן 21.2 מיליארד פרמטרים אבל רק 4 מיליארד פעילים בכל טוקן. החיבור הזה מאפשר לבצע משימות של הבנת תמונה והסקה טקסטואלית ברמת ביצועים גבוהה ובמהירות עבודה משופרת לעומת מודלים צפופים מלאים.

האימון כלל שלבי קדם אימון, כוונון להוראות ושיטה של למידת חיזוק מדורגת שמשלבת אופטימיזציית העדפות לא מקוונת לצד שלב מקוון. המודל כולל מצב חשיבה עמוקה שפותח בעזרת תהליכי הסקה של DeepSeek-R1, ומיועד להתמודד עם אתגרי ראייה מורכבים במתמטיקה, ממשקי משתמש גרפיים ומשימות של סוכנים אוטונומיים.

מתאים ל

  • ניתוח מסמכים ותרשימים

    שילוב יכולות החשיבה המתמטית מאפשר לפענח גרפים טכניים, טבלאות צפופות ונוסחאות מורכבות.

  • אוטומציה של ממשקי משתמש

    המודל אומן על נתוני אינטראקציה עם GUI ויכול לזהות אלמנטים ולכוון פעולות של סוכני תוכנה.

  • הסקה חזותית בתקציב מחשוב

    הפעלת 4 מיליארד פרמטרים מתוך 21 מיליארד מאפשרת להריץ יכולות היגיון גבוהות בעלות חישוב מופחתת.

איפה זה נופל

זהו שחרור מוקדם שמוגדר כגרסת תצוגה מקדימה, מה שאומר שחלקים מהתיעוד המלא ודוחות הביצועים הספציפיים לתצורה הזו טרם פורסמו לעומת שאר דגמי הסדרה. במצב חשיבה המודל נוטה לייצר חזרות מיותרות על טקסט, והמפתחים מנחים במפורש להפעיל דגימה עם טמפרטורה של 0.6 כדי לרסן את הבעיה הזו. בנוסף, חלון ההקשר המלא של 32 אלף טוקנים עלול להכביד מאוד על הזיכרון בעת העלאת מספר תמונות ברזולוציה גבוהה.

שאלות
נפוצות

כמה זיכרון כרטיס מסך נדרש להרצה מקומית?

בדיוק המקורי של bfloat16 המשקלים תופסים קרוב ל־40 גיגה בייט. להרצה יציבה עם תמונות וחלון הקשר פעיל תצטרכו כרטיס עם 48 עד 80 גיגה בייט זיכרון, או לחלופין לפצל את המודל על פני מספר כרטיסים.

איך מפעילים את מצב החשיבה המעמיק?

יש להגדיר את הפרומפט של המערכת בהתאם להנחיות הפרויקט ל־R1_SYSTEM_PROMPT. בנוסף, מומלץ להפעיל דגימה עם טמפרטורה של 0.6 כדי למנוע מהמודל לחזור על עצמו בלולאות טקסט.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־39.6 גיגה בייט בפורמט bfloat16, כך שאי אפשר לדחוף אותו לכרטיס מסך בודד של 24 גיגה בייט בלי קוונטיזציה משמעותית. כדי להריץ את המשקלים הגולמיים בצורה חלקה תצטרכו לפחות שרת עם שני כרטיסי A100 או H100, או כרטיס בודד של 80 גיגה בייט שישאיר מקום לטוקנים של התמונה ולהקשר של עד 32 אלף טוקנים.

אם אתם צריכים רק שאילתות בודדות או עיבוד תמונות מזדמן, עדיף להשתמש בדמו הרשת או ב־API חיצוני של המפתחים. הקמה עצמית שווה את המאמץ והעלות רק אם אתם חייבים פרטיות מלאה לנתונים או מתכננים עיבוד שוטף בנפחים שמצדיקים שרת ייעודי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL3_5-GPT-OSS-20B-A4B-Preview")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי של הקוד והפצה חופשית ללא תשלום תמלוגים, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗