GPT
I

InternVL3_5-30B-A3B

קוד פתוח

OpenGVLabapache-2.02025-08-25

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

מודל מולטימודלי של 31 מיליארד פרמטרים שמשלב עיבוד תמונה וטקסט. הוא מתאים למי שצריך יכולות חשיבה עמוקה ופעולות על ממשקי משתמש בלי להריץ מפלצות של מאות מיליארדים.

  • 31Bפרמטרים
  • 57.5 GBמשקל הקבצים
  • 13,327הורדות בחודש
  • 43לייקים

מה זה

המודל מבוסס על שילוב של מודל שפה עם 30.5 מיליארד פרמטרים ורכיב ראייה קומפקטי יחסית של 300 מיליון פרמטרים. הארכיטקטורה ממירה כל מקטע תמונה לייצוג דחוס של 256 תווים חזותיים לפני שהם מוזנים למודל השפה. תהליך האימון עבר שלב של למידת חיזוק מדורגת, שמשלב אופטימיזציית העדפות לא מקוונת לצד למידה מקוונת, במטרה לשפר את היציבות והדיוק בפתרון בעיות מורכבות.

התוספת המשמעותית בגרסה הזו היא מצב חשיבה שמיועד למשימות היסק, מתמטיקה וניתוח מדעי. הנתונים לאימון הזה נבנו באמצעות תיאור תמונות ולאחריו יצירת תהליכי פתרון מפורטים דרך מודל חיצוני שסוננו לפי תשובות נכונות. בנוסף ליכולות ראייה רגילות כמו זיהוי טקסט או מענה על שאלות מתמונה, הוסיפו כאן תמיכה באינטראקציה עם ממשקי משתמש וסוכנים פיזיים.

מתאים ל

  • אוטומציה של ממשקי משתמש

    הוא אומן על נתוני אינטראקציה עם מסכים ויודע לזהות אלמנטים גרפיים ולתכנן פעולות.

  • פתרון בעיות מתמטיקה ומדע

    מצב החשיבה מאפשר לו לפרק שאלות מורכבות מתרשימים וגרפים שלב אחר שלב.

  • עיבוד מסמכים ותמונות

    רכיב הראייה תומך ברזולוציה דינמית שמחלצת פרטים קטנים וטקסט מתוך תמונות מורכבות.

איפה זה נופל

מצב החשיבה דורש הגדרת פרומפט מערכת ייעודי ופרמטרים מוגדרים של דגימה עם טמפרטורה 0.6 כדי למנוע מהמודל לחזור על עצמו בלולאות אינסופיות. חלון ההקשר שהוגדר בשלב האימון המונחה עומד על 32 אלף תווים, כך שהוא לא בנוי למסמכים ארוכים במיוחד או לספריות קוד ענקיות. אין בתיעוד שום התייחסות לתמיכה בעברית או ביצועים בשפות שאינן אנגלית וסינית, וצריך לבדוק היטב איך הוא מתמודד עם טקסטים מקומיים לפני שמסתמכים עליו.

אותה משפחה

InternVL3-5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

מה ההבדל בין הקבצים האלה לגרסת ה־HF?

הגרסה הזו משתמשת במבנה הקוד המקורי של הפרויקט בגיטהאב. אם אתם רוצים להשתמש בספריית transformers הרגילה בלי תלויות חיצוניות מיוחדות, עדיף להוריד ישירות את הגרסה שמסתיימת בסיומת HF או להריץ את סקריפט ההמרה שהם מספקים.

איך מפעילים את מצב החשיבה המעמיק?

צריך להגדיר פרומפט מערכת ייעודי בשם R1_SYSTEM_PROMPT שמופיע בקוד שלהם, ולהפעיל דגימה עם טמפרטורה של 0.6. בלי ההגדרות האלה המודל יענה תשובות ישירות וקצרות בלי תהליך ההיסק המלא.

איך מריצים

כדי להריץ אותו צריך להוריד 57.5 גיגה בייט של משקלים בפורמט bfloat16. זה אומר שבשביל הסקה מקומית תצטרכו לפחות 64 גיגה בייט של זיכרון כרטיס מסך, מה שמחייב שימוש בכרטיס מקצועי כמו A100 או שני כרטיסי 4090 אם מבצעים חלוקה או קוונטיזציה. המודל תומך בפיצול עבודה שבו רכיב הראייה ומודל השפה יושבים על מעבדים גרפיים נפרדים לאיזון עומסים.

שימו לב שהמשקלים כאן מגיעים בפורמט מותאם של גיטהאב ולא בפורמט הסטנדרטי הרגיל של transformers, כך שצריך להמיר אותם בעזרת הסקריפטים של הפרויקט אם אתם רוצים תאימות ישירה. אם אין לכם גישה לשרת ייעודי עם החומרה הזו, להרים שרת ענן במיוחד בשבילו זה יקר, ועדיף לבדוק קודם פתרונות ענן מנוהלים או גרסאות קטנות יותר בסדרה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL3_5-30B-A3B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache 2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗