GPT
G

git-large-coco

קוד פתוח

microsoftmit2023-01-02

  • transformers
  • pytorch
  • safetensors
  • git
  • image-text-to-text

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

המודל מייצר תיאורי תמונה באנגלית ומבוסס על אימון ייעודי למשימה הזו בדיוק. הוא קומפקטי מספיק כדי לרוץ מקומית בלי שרתים מנופחים כשצריכים כיתוב מהיר לתמונות.

  • 394Mפרמטרים
  • 1,024טוקנים בהקשר
  • 2.9 GBמשקל הקבצים
  • 3,128הורדות בחודש

מה זה

מדובר במודל שמחבר ראייה ממוחשבת ויצירת טקסט על בסיס ארכיטקטורת מפענח, שמקבלת ייצוגי תמונה של קליפ וטוקנים של טקסט כדי לנחש את המילה הבאה. המודל הספציפי הזה אומן מראש על עשרים מיליון זוגות של תמונה וטקסט ולאחר מכן עבר כוונון עדין על מערך הנתונים קוקו, בשונה מגרסאות הענק שמוזכרות במאמר המקורי ולא שוחררו כקוד פתוח.

המטרה העיקרית שלו היא יצירת תיאורים לתמונות, אך המבנה שלו מאפשר עקרונית גם מענה לשאלות על גבי תמונה וסיווג תמונה באמצעות טקסט. הנתונים בכרטיס לא כוללים מדדי ביצועים מספריים ומפנים למאמר, כך שקשה לדעת מהכרטיס בלבד כמה הוא מדויק ביחס לחלופות עד שלא בודקים אותו ישירות על התמונות שלכם.

מתאים ל

  • תיאור תמונות לנגישות

    יצירה אוטומטית של טקסט חלופי לתמונות באתרי אינטרנט באנגלית, ישירות מתוך מסד נתונים קיים.

  • אינדוקס קטלוג מוצרים

    המרת תמונות מלאי למשפטי מפתח פשוטים כדי לאפשר חיפוש טקסטואלי מהיר ללא תיוג ידני.

  • סיווג תמונות פשוט

    זיהוי התוכן בתמונה על ידי הנחיית המודל לפלוט את שם הקטגוריה המתאימה כטקסט.

איפה זה נופל

המודל אומן ויודע לעבוד רק באנגלית, כך שהוא לא יעזור בכלל למי שצריך תיאורים בעברית בלי שכבת תרגום נוספת באמצע. בנוסף, הכוונון שלו נעשה על מערך הנתונים קוקו, מה שאומר שהוא נוטה לייצר תיאורים תמציתיים ויבשים שמתאימים לתיוג חפצים יומיומיים ולא בהכרח יבין מסמכים, גרפים מורכבים או צילומי מסך טכניים.

צוות הפיתוח המקורי של מיקרוסופט כלל לא כתב את כרטיס המודל אלא צוות האגינג פייס, מה שמשאיר פערי מידע לגבי מגבלות בטיחות והטיות שהיו באימון.

שאלות
נפוצות

האם המודל תומך בהזנת פרומפטים בעברית?

לא. המודל אומן על נתונים באנגלית בלבד ומוגדר לשפה זו. כדי לקבל תוצאות בעברית תצטרכו לתרגם את הפלט שלו.

האם אפשר להשתמש בו לניתוח וידאו?

הארכיטקטורה הכללית של גיט תומכת גם בווידאו לפי התיעוד, אך המשקולות הספציפיות האלו עברו כוונון על קוקו שמכיל תמונות סטילס בלבד. הוא מתאים לעיבוד פריימים בודדים ולא להבנת רצף וידאו מתמשך.

איך מריצים

עם משקל קבצים של 2.9 גיגה בייט וכ־394 מיליון פרמטרים בפורמט פלואוט שלושים ושתיים, אפשר להריץ אותו בקלות על מעבד גרפי ביתי פשוט, ולמעשה הוא יכול לרוץ גם על מעבד רגיל אם זמן התגובה פחות קריטי לכם. הוא נתמך ישירות בספריית טרנספורמרס, מה שאומר שההטמעה בקוד פייתון דורשת שורות בודדות.

אם אתם צריכים תיאורים למאות אלפי תמונות ביום ברצף, הרצה עצמית על שרת ייעודי תהיה זולה ופשוטה יותר מחיבור לכל שירות חיצוני. אם המטרה היא להריץ שאילתה פעם ביום, הקמה ותחזוקה של סביבה עבורו תהיה בזבוז זמן ועדיף לפנות לממשק חיצוני מוכן.

from transformers import pipeline

pipe = pipeline("image-to-text", model="microsoft/git-large-coco")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לשלב אותו במוצר סגור ולהפיץ אותו, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗