GPT
V

Vintern-1B-v2

קוד פתוח

5CD-AImit2024-08-09

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • vision

מודל ראייה ושפה קטן במיוחד שנועד לרוץ על חומרה בסיסית, עם דגש מוחלט על עיבוד מסמכים ותמונות בווייטנאמית. הוא מתאים למי שצריך חילוץ מידע מקומי מהיר וזול בלי שרתים כבדים.

  • 938Mפרמטרים
  • 1.8 GBמשקל הקבצים
  • 1,144הורדות בחודש
  • 82לייקים

מה זה

הבסיס כאן מחבר בין מודל הראייה InternViT-300M-448px למודל הטקסט הקטן Qwen2-0.5B-Instruct, לצד שכבת חיבור של MLP. המטרה של הצוות הייתה לבנות כלי קל משקל שמסוגל לקרוא מסמכים, טפסים וקבלות, להבין שאלות על תרשימים ולבצע פעולות ראייה בסיסיות. האימון הנוסף התבסס על מעל שלושה מיליון זוגות של שאלות ותשובות מתמונות, כמעט כולם סביב תכנים בווייטנאמית כמו פענוח כתב יד, קבלות וסריקות קוד.

במדד MTVQA לשפה הווייטנאמית הוא הגיע לציון 31.7, מה שמציב אותו במקום השלישי בטבלה שלהם, מעל דגמים מוכרים כמו Qwen2-VL 7B או Claude3 Opus ומעט מתחת ל־GPT-4o שקיבל 34.2. זה נתון מפתיע לגודל שלו, אבל המשמעות ברורה. ההתמחות הצרה הזו הופכת אותו לחד מאוד בשפה הזו על גבי מסמכים, על אף שרכיב השפה שלו מחזיק רק חצי מיליארד פרמטרים.

מתאים ל

  • קריאת קבלות בווייטנאמית

    הוא עבר אימון ייעודי על נתוני קבלות מקומיות ומסוגל לחלץ סכומים ושורות פריטים בדיוק גבוה.

  • זיהוי כתב יד מסמכי

    מאגר האימון הכיל סריקות ייעודיות של כתב יד, מה שמאפשר לו לקרוא פתקים וטפסים ממולאים.

  • הפעלה במכשירי קצה

    הגודל הזעיר מאפשר לו לרוץ מקומית בלי חומרה יקרה ובלי תלות בחיבור רשת רציף.

איפה זה נופל

החולשה העיקרית היא מיקוד היתר בשפה הווייטנאמית. הדגם אומן כמעט בלעדית על נתונים מקומיים, ולכן אין מה לבנות עליו למשימות בעברית, והיכולת שלו באנגלית מוגבלת למדי על גבי מודל בסיס של 0.5B פרמטרים. בנוסף, חלון ההקשר עומד על 4096 טוקנים בלבד, כך שהוא לא יתמודד עם מסמכים ארוכים ומרובי עמודים. ההערכה שלו בכרטיס התבססה בחלקה על ציון שנתן GPT-4, כך שצריך לבדוק אותו ישירות על הנתונים שלכם לפני שסומכים על הפלטים שלו בעיבוד שגיאות קריטי.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל פותח ואומן עבור וייטנאמית ואנגלית בלבד. מודל הטקסט שעליו הוא נשען קטן מדי מכדי להכיל ידע סביר בשפות נוספות שלא נכללו באימון.

האם אפשר לאמן אותו על נתונים פרטיים?

כן, המפתחים מספקים מחברת שמאפשרת אימון ישיר על גבי כרטיס T4 בסיסי. הגודל הקטן שלו הופך אימון נוסף לתהליך מהיר וזול יחסית.

איך הוא עוקף מודלים גדולים במדד?

הוא הותאם בדיוק למבחני ראייה ספציפיים בווייטנאמית שעליהם נמדד. במשימות שפה כלליות או בשפות אחרות מודלים כמו GPT-4o עדיין עולים עליו בהרבה.

איך מריצים

בזכות משקל של 1.8 גיגה בייט בלבד, קל להריץ אותו ישירות דרך ספריית transformers בסביבות מוגבלות או על מכשירי קצה. הוא מתאים לעבודה על כרטיס גרפי צנוע, ואפילו אימון והתאמה אישית מתבצעים בלי בעיה על גבי מעבד גרפי T4 רגיל ב־Colab.

אם כל מה שאתם צריכים זה לחלץ טקסט מתמונות בווייטנאמית, שווה להריץ אותו לבד ולחסוך עלויות שרתים. לעומת זאת, אם המשימות כוללות אנגלית מורכבת או שפות אחרות, פנייה ל־API מסחרי סטנדרטי תיתן תוצאות עקביות בהרבה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="5CD-AI/Vintern-1B-v2")
print(pipe("שלום"))

הרישיון

הפרויקט שוחרר תחת רישיון MIT. המשמעות היא חופש מלא לשימוש מסחרי, שינוי קוד, הפצה ושילוב במוצרים סגורים, בלי דרישה לחלוק את הקוד שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית בתוך קובצי ההפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗