GPT
I

InternVL3-1B

קוד פתוח

OpenGVLabapache-2.02025-04-10

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • internvl

זהו מודל ראייה ושפה קומפקטי שמחבר מקודד תמונה לרכיב טקסט של חצי מיליארד פרמטרים. הוא מיועד למי שחייב עיבוד תמונה מקומי ומהיר בלי להחזיק שרת יקר.

  • 938Mפרמטרים
  • 1.8 GBמשקל הקבצים
  • 155,035הורדות בחודש
  • 84לייקים

מה זה

הארכיטקטורה מורכבת מרכיב ראייה מסוג InternViT-300M-448px-V2_5 שמחובר באמצעות שכבת MLP למודל שפה זעיר, Qwen2.5-0.5B. בניגוד לגישה הרגילה שמחברת מודל שפה מאומן למודל ראייה בשלב מאוחר, כאן השתמשו באימון מקדים רב־מודאלי שמשלב טקסט ותמונות יחד מההתחלה, לצד כוונון בשיטת MPO שנועד לצמצם שגיאות בשרשראות חשיבה.

הוא מסוגל לקבל תמונה אחת, רצף תמונות או וידאו, ומפרק תמונות למקטעים של 448 על 448 פיקסלים כדי לטפל ברזולוציות משתנות. בנוסף שולב בו קידוד מיקום ויזואלי גמיש בשם V2PE שמשפר הבנה בהקשרים ארוכים. המטרה כאן אינה להתחרות בענקי ענן, אלא לתת מענה ממוקד למשימות ויזואליות בסיסיות, הפעלת ממשקי משתמש, וניתוח מסמכים תחת משאבים אפסיים.

מתאים ל

  • זיהוי אלמנטים בממשק

    התאמה טובה לניתוח צילומי מסך בסיסיים וזיהוי כפתורים בזכות שילוב נתוני אימון ייעודיים לתפעול ממשקים גרפיים.

  • סריקת מסמכים פשוטים

    עיבוד תעודות ותמונות עם מעט טקסט ישירות על חומרה מקומית קלה, בלי תלות ברשת ובלי עלויות ענן.

  • סינון ראשוני של תמונות

    מיון מהיר של תמונות או קטעי וידאו לפי תיאור כללי כשלב מקדים במערכות עיבוד גדולות.

איפה זה נופל

בסיס השפה שלו נשען על מודל של חצי מיליארד פרמטרים, גודל מינימליסטי שמועד להזיות חמורות, כשלים בהבנת הנחיות מורכבות וקושי בניסוח תשובות ארוכות. הכרטיס מדגיש צורך במנגנוני דירוג חיצוניים כמו מודל שופט בשלב הבדיקות כדי לחלץ תשובות היגיון טובות, מה שמעיד על חוסר יציבות מובנה בחשיבה עצמאית. בנוסף, חלוקת תמונות להרבה מקטעים מייצרת עומס חישובי מהיר ועלולה לפגוע בדיוק אם מנסים לנתח פרטים זעירים מדי.

אותה משפחה

InternVL3 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יבין עברית מתוך תמונות?

המודל מוגדר רב־לשוני, אך בסיס השפה שלו זעיר ורוב האימון הוויזואלי התמקד באנגלית ובסינית. הוא כנראה יתקשה מאוד לפענח כתב עברי מתמונה או להחזיר תשובות מנוסחות היטב בעברית בלי אימון ייעודי נוסף.

למה מופיעה בקוד הרצה דרישה לכרטיסי שמונים גיגה בייט?

מדובר בהעתקה של סקריפט הדגמה מהגרסאות הענקיות של אותה משפחה, כמו דגמי השבעים מיליארד. המודל הספציפי הזה שוקל פחות משני גיגה בייט וירוץ על כמעט כל כרטיס מסך מודרני.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.8 גיגה בייט בלבד בדיוק bfloat16, כך שהוא נכנס בקלות לתוך כרטיס מסך צרכני פשוט או מעבד עם זיכרון צנוע באמצעות ספריית transformers. הטעינה דורשת הגדרת trust_remote_code כיוון שהיא משתמשת בקוד ייעודי של הארכיטקטורה, ומומלץ להפעיל את Flash Attention לביצועים תקינים.

אמנם כרטיס המודל כולל בטעות הערת קוד גנרית מהדגמים הכבדים שמזכירה שרתי שמונים גיגה בייט, אך בפועל דגם של 938 מיליון פרמטרים רץ מקומית בלי מאמץ. אם המטרה שלכם היא פענוח טקסט מורכב מאוד או פתרון בעיות היגיון סבוכות מתמונות, עדיף לפנות ישירות למודל גדול בהרבה דרך שירות חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="OpenGVLab/InternVL3-1B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה פנימית או חיצונית, בתנאי ששומרים על הצהרת זכויות היוצרים המקורית ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗