GPT
V

vit-gpt2-coco-en

קוד פתוח

ydshiehרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • tensorboard

חיבור פשוט בין ראייה ממוחשבת למודל שפה קטן מייצר תיאורי תמונות בסיסיים באנגלית. הוא שוקל מעט ויכול להתאים לבדיקת היתכנות מקומית בלי לסבך את התשתית.

  • 239Mפרמטרים
  • 3.6 GBמשקל הקבצים
  • 11,878הורדות בחודש
  • 39לייקים

מה זה

מדובר בשילוב ישיר בין ViT לבין GPT-2 שנועד לקחת תמונה ולהוציא משפט שמתאר אותה באנגלית. הוא אומן על COCO, כך שהוא מכיר בעיקר חפצים יומיומיים, אנשים ובעלי חיים בסביבות פשוטות ומוכרות. היוצר מעיד בעצמו שהמודל לא מתיימר להיות בחזית הטכנולוגיה, אלא משמש בעיקר הדגמת יכולת למסגרת העבודה של Flax Vision Encoder Decoder.

בגודל של 239 מיליון פרמטרים אין כאן שום קסם של מודלים מודרניים רב-מודאליים. הוא לא מנתח לעומק יחסים מורכבים בפריים ולא מספק פסקאות מפורטות, אלא זורק שורת תיאור תמציתית. היתרון היחיד של הגודל הזה הוא היכולת להרים משהו קל ומהיר שעובד מקומית, בלי צורך במערכי שרתים מנופחים.

מתאים ל

  • בדיקת היתכנות מקומית

    מאפשר לבדוק תהליך של יצירת כיתוב לתמונה על מחשב פיתוח רגיל וללא עלויות ענן.

  • תיוג ראשוני של תמונות

    מספק תיאור בסיסי באנגלית לחפצים ועצמים ברורים מתוך מאגרים פשוטים.

  • התנסות ב־Flax

    מדגים עבודה ישירה עם ארכיטקטורת קידוד ופענוח של Hugging Face בסביבת Flax.

איפה זה נופל

היוצר מציין במפורש שהמודל רחוק מלהיות בחזית התחום. האימון על COCO מגביל אותו לעולם מושגים מצומצם, והוא נוטה לייצר תיאורים שטחיים או שגויים כשהקומפוזיציה מורכבת. הוא עובד באנגלית בלבד, כך שאין מה לבנות עליו לפלט בעברית, ולפני שמכניסים אותו לתהליך עבודה צריך לבדוק כמה הזיות הוא מייצר על תמונות שחורגות מהמאגר המקורי.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה כדי להפיק כיתוב בעברית?

לא. המודל אומן על COCO באנגלית ומבוסס על GPT-2 באנגלית, כך שהוא לא תומך בעברית. כדי לקבל תיאור בעברית תצטרכו לתרגם את הפלט בנפרד או לאמן מודל אחר.

האם כדאי להטמיע אותו במוצר מסחרי קיים?

לא מומלץ. לא מוגדר לו רישיון שימוש, והוא נבנה כהוכחת יכולת ישנה יחסית ממרץ 2022. התוצאות שלו בסיסיות מאוד לעומת מה שקיים היום בשוק.

איך מריצים

בזכות 239 מיליון פרמטרים ומשקל קבצים של 3.6 גיגה-בייט, לא צריך חומרה מיוחדת כדי לעבוד איתו. כרטיס מסך בסיסי או מעבד מודרני יריצו אותו בלי בעיה דרך ספריית transformers בפייתון, עם תמיכה ב־PyTorch או ב־Flax.

אם אתם רק צריכים לבדוק תיוג תמונות מהיר כחלק מניסוי פנימי, ההרצה המקומית הגיונית. לעומת זאת, אם המטרה היא מערכת ייצור שמצריכה זיהוי מדויק או תיאורים עשירים, עדיף להשתמש ב־API של מודלים מודרניים ולא לבזבז זמן על אחזקת שרת למודל מיושן יחסית.

from transformers import pipeline

pipe = pipeline("image-to-text", model="ydshieh/vit-gpt2-coco-en")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא דווח רישיון כלל. מבחינה משפטית, כשאין רישיון מוגדר אין היתר ברור לשימוש מסחרי או להפצה בתוך מוצר. אם אתם בונים מערכת מסחרית, כדאי להימנע משימוש בו עד לבירור מול היוצר.

הרישיון המלא בעמוד המודל ↗