GPT
I

InternViT-300M-448px

קוד פתוח

OpenGVLabmit2024-05-24

  • transformers
  • safetensors
  • intern_vit_6b
  • feature-extraction
  • image-feature-extraction

מודל ראייה קומפקטי שמיועד לחילוץ מאפיינים ומבוסס על זיקוק של מודל ענק. הוא שוקל מעט מאוד, תומך ברזולוציה דינמית, ומביא יכולות פענוח טקסט מתקדמות לגודל שלו.

  • 304Mפרמטרים
  • 646 MBמשקל הקבצים
  • 14,041הורדות בחודש
  • 62לייקים

מה זה

מדובר בעמוד שדרה ויזואלי של 304 מיליון פרמטרים, שנוצר באמצעות זיקוק ידע מהמודל הגדול יותר בסדרה, InternViT-6B-448px-V1-5. המטרה העיקרית כאן היא יעילות חישובית מבלי לאבד את היכולת להתמודד עם תמונות מורכבות. הוא פועל על חלוקה לאריחים בגודל 448 על 448 פיקסלים, כאשר בזמן בדיקה אפשר לפרוס תמונה לעד 40 אריחים שונים כדי לשמור על פרטים קטנים.

האימון שלו כלל מאגרי תמונות כלליים לצד דאטה ייעודי למשימות OCR באנגלית ובסינית, כולל שימוש במידע שחולץ עם PaddleOCR. המשמעות היא שהוא קורא טקסט מתוך תמונות טוב בהרבה מרוב מודלי הראייה הסטנדרטיים בגודל הזה, ומייצר ייצוגים וקטוריים עשירים מאוד שמתאימים לחיבור למודלי שפה.

מתאים ל

  • עמוד שדרה למודל שפה

    חיבור כרכיב ויזואלי למודל טקסט כדי להפוך אותו למודל מולטימודל שלם.

  • חילוץ וקטורים ממסמכים

    יצירת ייצוגים מתמונות המכילות טקסט מרובה, בזכות הדגש החזק על OCR.

  • ניתוח תמונות ברזולוציה גבוהה

    עיבוד תמונות מורכבות באמצעות מנגנון החלוקה לעד 40 אריחים שונים.

איפה זה נופל

היוצרים עצמם מזהירים שהמשפחה הזו מתאימה בעיקר כבסיס לבניית מודלי מולטימודל, ופחות למשימות ראייה ממוחשבת קלאסיות כמו סגמנטציה או זיהוי אובייקטים סטנדרטי. בנוסף, חלוקת תמונות למספר רב של אריחים, עד 40 אריחים, אומנם מעלה את הרזולוציה אבל תדרוש מכם משאבי עיבוד גבוהים משמעותית ותאט את זמן הריצה. אם אתם מחפשים מודל שמחזיר תשובות טקסט ישירות ולא רק וקטורים, זה לא הכלי, כי הוא מחלץ מאפיינים בלבד.

שאלות
נפוצות

האם המודל הזה מייצר תשובות בטקסט לשאלות על תמונה?

לא. מדובר במודל שמחלץ מאפיינים ויזואליים בלבד ומחזיר טנזורים של וקטורים. כדי לקבל צ'אט או תשובות טקסט, צריך לחבר אותו למודל שפה נפרד.

האם המודל מזהה טקסט בעברית מתוך תמונות?

האימון הייעודי של הראייה והטקסט התמקד בעיקר באנגלית ובסינית דרך מאגרים כמו Wukong ו־LAION. החומר הרשמי אינו מציין תמיכה בעברית, ולכן פענוח אותיות עבריות צפוי להיות חלש מאוד.

איך מריצים

במשקל של 646 מגה בייט ודיוק bfloat16, המודל הזה רץ כמעט על כל כרטיס מסך מודרני בלי להרגיש אותו, ואפילו מעבד גרפי פשוט עם 4 או 6 גיגה זיכרון יחזיק אותו בקלות. טוענים אותו ישירות דרך ספריית transformers הרגילה של פייתון, אבל חובה להפעיל את האפשרות של trust_remote_code בקוד כדי שהארכיטקטורה תטען כמו שצריך.

אין שום סיבה לחפש פה ספק ענן או API חיצוני. בגלל המשקל הזעיר שלו, הרבה יותר זול, מהיר ופרטי להריץ אותו מקומית על השרת שלכם או ישירות בתחנת העבודה, במקום לשלם על קריאות רשת וזמני השהיה.

from transformers import pipeline

pipe = pipeline("image-feature-extraction", model="OpenGVLab/InternViT-300M-448px")
print(pipe("שלום"))

הרישיון

רישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצרים סגורים ולהפיץ אותו הלאה. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗