GPT
G

git-base

קוד פתוח

microsoftmit2022-12-06

  • transformers
  • pytorch
  • safetensors
  • git
  • image-text-to-text

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל קל במיוחד להמרת תמונה לטקסט שמייצר תיאורים או עונה על שאלות. הוא מתאים למי שחייב מודל ראייה מקומי וזול בחומרה בלי להזדקק לשרתים כבדים.

  • 177Mפרמטרים
  • 1,024טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 31,992הורדות בחודש

מה זה

מיקרוסופט ארזה כאן ארכיטקטורה פשוטה יחסית שמחברת טוקנים של תמונה דרך CLIP ישירות אל מפענח טקסט, בלי סיבוכים מיותרים מסביב. המודל מתבסס על גישה של חיזוי הטוקן הבא, כך שבאמצעות פרומפט טקסט ותמונה הוא מייצר תיאור קצר, מסווג את התמונה לקטגוריה או עונה על שאלות שקשורות אליה, ואפילו מסוגל לעבוד עם פריימים של וידאו.

בניגוד לגרסה המלאה מהמאמר המקורי שאומנה על 800 מיליון זוגות תמונה וטקסט ולא שוחררה לציבור, הגרסה הזו אומנה על 10 מיליון זוגות בלבד. זה אומר שמקבלים משקל נוצה של 177 מיליון פרמטרים, אבל גם ירידה ביכולת ההכללה בהשוואה לתוצאות המקוריות שמיקרוסופט הציגה במחקר.

מתאים ל

  • תיאור תמונות אוטומטי

    יצירת כיתובים באנגלית לתמונות באתרי תוכן, כשהנפח גבוה והתקציב לחומרה מוגבל.

  • מענה על שאלות חזותיות

    חילוץ תשובות פשוטות מתוך תמונות, כל עוד השאלות וההקשר מנוסחים באנגלית.

  • סיווג תמונות ישיר

    זיהוי קטגוריות על ידי הפקת שם המחלקה בטקסט במקום אימון מסווג ייעודי מראש.

איפה זה נופל

המודל תומך באנגלית בלבד. אם תנסו לתשאל אותו בעברית או תצפו לתיאור תמונה בעברית, תקבלו ג'יבריש או חוסר הבנה מוחלט. מעבר לזה, מדובר בגרסה בסיסית וגולמית שלא עברה התאמה ספציפית למשימות מורכבות. כרטיס המודל מציין במפורש שהתוצאות שייכות למאמר ולא מוצגות בו ישירות, כך שחובה לבדוק אותו על הנתונים שלכם לפני שסומכים על רמת הדיוק שלו בזיהוי פרטים קטנים או קריאת טקסט מתוך תמונות.

שאלות
נפוצות

האם המודל מבין ומייצר עברית?

לא. המודל אומן על נתונים באנגלית בלבד ואינו תומך בעברית. כדי להשתמש בו בישראל תצטרכו לתרגם את השאלות לאנגלית ואת הפלט חזרה לעברית בעזרת כלי נפרד.

האם כדאי להשתמש בו ישירות מהקופסה בלי אימון נוסף?

הוא מתאים מהקופסה בעיקר לתיאור תמונות בסיסי. לכל משימה אחרת כמו מענה מורכב על שאלות או סיווג מדויק, כדאי לבדוק גרסאות מכווננות שלו או לאמן אותו בעצמכם על הנתונים שלכם.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.3 גיגה בייט בדיוק float32, כך שכל מעבד גרפי פשוט ואפילו מעבד מרכזי רגיל יכולים להריץ אותו בלי מאמץ דרך ספריית transformers. אין צורך בשרת יקר עם כרטיסי תצוגה מפלצתיים, וזה בדיוק היתרון של מודל עם שש שכבות בלבד.

אם אתם צריכים תיאורים שטחיים ומהירים בכמויות גדולות, הרצה מקומית עצמאית תחסוך לכם כסף על קריאות רשת. לעומת זאת, אם הדיוק הוא קריטי או שהתמונות מורכבות, עדיף להשתמש במודלי שפה וראייה גדולים דרך ספקי ענן במקום להילחם ביכולות המצומצמות שלו.

from transformers import pipeline

pipe = pipeline("image-to-text", model="microsoft/git-base")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שיש לכם חופש מלא לעשות בו מה שתרצו. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, לאמן עליו מחדש או להפיץ אותו הלאה, כל עוד אתם משאירים את הקרדיט והודעת הרישיון המקורית של מיקרוסופט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗