GPT
I

InternVL3-2B

קוד פתוח

OpenGVLabapache-2.02025-04-10

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

זה מודל ראייה ושפה קומפקטי שמחבר מקודד תמונה של 300 מיליון פרמטרים עם מודל שפה של 1.5B. הוא נותן הבנת תמונה טובה בלי לדרוש חומרת שרתים כבדה.

  • 2.1Bפרמטרים
  • 3.9 GBמשקל הקבצים
  • 28,992הורדות בחודש
  • 46לייקים

מה זה

הארכיטקטורה מורכבת מראיית מחשב מסוג InternViT-300M-448px-V2_5 שמחוברת למודל השפה Qwen2.5-1.5B באמצעות שכבת MLP. התמונות מחולקות למשבצות בגודל 448 על 448 פיקסלים, ודחיסת פיקסלים מקצצת את כמות הטוקנים הוויזואליים לרבע מהמקור כדי לחסוך זיכרון. המודל תומך בריבוי תמונות, בניתוח וידאו, ובממשקי משתמש גרפיים.

בניגוד לאימון בשלבים נפרדים, כאן אימנו את רכיבי השפה והראייה ביחד מההתחלה עם טקסט ותמונות משולבים. בנוסף הוכנס קידוד מיקום ויזואלי גמיש יותר בשם V2PE, שמשפר הבנה בהקשרים ארוכים ומשימות מורכבות. שיטת האופטימיזציה MPO משלבת דוגמאות חיוביות ושליליות כדי לצמצם סטיות בזמן יצירת תשובות בשרשרת חשיבה.

מתאים ל

  • הבנת מסמכים מקומית

    חילוץ טקסט ופרטים מטפסים ותמונות ישירות על מחשב קצה בלי לשלוח מידע רגיש לשירותי ענן.

  • ניתוח רצפי וידאו פשוטים

    זיהוי פעולות ותיאור אירועים ברצף פריימים בזכות התמיכה בריבוי תמונות ומשקל חישובי קל.

  • אוטומציה בממשקי משתמש

    זיהוי אלמנטים על המסך עבור סוכני GUI במערכות שבהן זמן התגובה וצריכת המשאבים קריטיים.

איפה זה נופל

זה מודל של 2.1 מיליארד פרמטרים, וכשמבקשים ממנו הסקת מסקנות עמוקה, פענוח טקסט מורכב מאוד או חישובים מתמטיים קשים הוא ייפול הרבה לפני האחים הגדולים שלו בסדרה כמו 38B או 78B. אם אתם צריכים דיוק גבוה בעברית, חובה לבדוק אותו מראש, כי בסיס השפה מגיע מ־Qwen2.5 קטן והיכולות שם מוגבלות ביחס לאנגלית או סינית.

אותה משפחה

InternVL3 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

באמת צריך שלושה כרטיסי 80GB כמו שכתוב בקוד?

לא. ההערה הזו שורבבה מהדוקומנטציה של הדגמים הגדולים יותר בסדרה. המודל שוקל פחות מארבעה גיגה בייט ומסתפק לחלוטין בכרטיס מסך ביתי אחד.

הוא מתאים לניתוח תמונות ברזולוציה גבוהה?

כן. הוא חותך תמונות למשבצות של 448 פיקסלים לפי יחס התמונה המקורי, עד 12 מקטעים, כך שפרטים קטנים נשמרים ולא נמרחים.

איך הוא מתמודד עם טקסט בעברית בתוך תמונות?

כרטיס המודל מציין תמיכה רב לשונית, אך ליבת השפה היא גרסה זעירה של Qwen2.5. לא הייתי בונה עליו לחילוץ עברית מורכבת בלי בדיקה יסודית על הדאטה שלכם.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בגרסה 4.37.2 ומעלה, עם bfloat16 והרשאת trust_remote_code. כל המשקלים יושבים בערך על 3.9 גיגה בייט, כך שכרטיס מסך פשוט עם 6 עד 8 גיגה בייט של VRAM מספיק כדי להריץ אותו, ואפשר גם לכווץ ל־8 ביט עם bitsandbytes.

הקוד בדף המודל מכיל הערת העתק־הדבק שממליצה על שניים או שלושה כרטיסי 80GB, אבל מדובר בשאריות מהגרסאות הענקיות של 78B. מודל של 2.1 מיליארד פרמטרים רץ מקומית בלי למצמץ, וממש אין סיבה לפנות ל־API חיצוני רק בגלל עומס חישובי, אלא אם אין לכם שום GPU זמין.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL3-2B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗