GPT
F

flava-full

קוד פתוח

facebookbsd-3-clause2022-04-09

  • transformers
  • pytorch
  • flava
  • pretraining
  • endpoints_compatible

מודל רב-מודאלי שמטפל בתמונות, בטקסט ובשילוב ביניהם בארכיטקטורה אחת פתוחה לחלוטין. הוא פותח כדי להציע חלופה לשחזור עצמאי מול מודלים סגורים כמו קליפ.

  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 21,564הורדות בחודש
  • 43לייקים

מה זה

הארכיטקטורה מבוססת על מקודדי ViT-B/32 נפרדים לתמונה ולטקסט, ומעליהם מקודד רב-מודאלי בעל שש שכבות. בשונה מפתרונות שמחברים שני מודלים נפרדים בדיעבד, הוא אומן מראש על 70 מיליון זוגות של תמונה וטקסט ממקורות פתוחים בלבד, לצד מאגרי טקסט ותמונות עצמאיים כמו אימג'נט ובוק-קורפוס. המבנה הזה מאפשר לחלץ אמבדינג לתמונה לבד, לטקסט לבד, או להריץ את שניהם יחד למשימות הבנה משולבות.

בבדיקות של החוקרים על פני 35 משימות שונות, הוא הציג ממוצע ציונים כולל גבוה יותר מקליפ, במיוחד במשימות שדרשו הבנת שפה עמוקה ולא רק התאמת תגים. מצד שני, במשימות סיווג תמונה טהורות הוא עדיין מפגר לעיתים אחרי חלופות ייעודיות, כך שהיתרון המרכזי שלו מתבטא בעיקר כששני העולמות נפגשים.

מתאים ל

  • שליפת תמונות לפי תיאור

    התאמת שאילתות טקסט באנגלית למאגר תמונות באפס דוגמאות מוקדמות, הודות למרחב הוקטורי המשותף.

  • מענה על שאלות חזותיות

    אימון שכבות עליונות על המקודד הרב-מודאלי כדי להשיב על שאלות שמתייחסות ישירות לתוכן של תמונה.

  • מחקר על מודלים מאוחדים

    בדיקת ארכיטקטורה פתוחה לחלוטין שמאפשרת שחזור מלא של תהליך האימון ממאגרי מידע ציבוריים.

איפה זה נופל

היוצרים מבהירים שהכלי נבנה למחקר ולא יועד לשימוש בסביבת ייצור מסחרית ללא בדיקות מעמיקות. הוא אומן והוערך באנגלית בלבד, ולכן הוא לא מתאים לעיבוד טקסט בעברית ללא אימון מחדש. בנוסף, הוא מתקשה בזיהוי טקסט שמופיע בתוך תמונות בגלל מחסור בדוגמאות כאלו במאגר האימון שלו, ובחלק ממשימות השפה הטהורות הוא מציג דיוק נמוך יותר מברט.

שאלות
נפוצות

האם המודל מבין פקודות או טקסט בעברית?

לא. נתוני האימון כללו אנגלית בלבד, וכל ניסיון להזין עברית לטוקנייזר יוביל לתוצאות חסרות משמעות. כדי לעבוד איתו בארץ תצטרכו לתרגם את השאילתות לאנגלית מראש או לבצע אימון המשך על נתונים מקומיים.

האם הוא מהווה תחליף ישיר לקליפ של אופן איי-איי?

בחלק מהמשימות כן, ובחלק לא. במשימות שמערבות שפה טבעית מורכבת הוא לעיתים עולה על קליפ, אך בסיווג תמונות טהור הוא עשוי להציג ביצועים נמוכים יותר. היתרון העיקרי שלו מול קליפ הוא שקיפות מוחלטת של נתוני האימון והארכיטקטורה.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.3 גיגה-בייט בפורמט של שלושים ושתיים ביט, כך שאין שום בעיה לטעון אותו על כרטיס מסך ביתי בסיסי או אפילו על מעבד רגיל. הספריה טרנספורמרס תומכת בו ישירות, ומאפשרת לטעון רק את מקודד התמונה, רק את מקודד הטקסט, או את המודל המלא כולל ראשי האימון המקוריים.

אם אתם צריכים רק חיפוש טקסט מול תמונה בסביבת ייצור, פנייה לשירותי ענן מוכנים תחסוך תחזוקה, אבל אם המטרה היא להריץ בדיקות מקומיות או לאמן שכבות נוספות על חומרה פנימית בלי תלות חיצונית, המשקל הקל מאפשר הרצה שוטפת בלי משאבים מיוחדים.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/flava-full")
print(pipe("שלום"))

הרישיון

רישיון BSD שלוש פסקאות מתיר שימוש מסחרי, הפצה ושינוי של הקוד והמשקלים ללא תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והסרת אחריות מהיוצרים. עם זאת, יוצרי המודל הגדירו בתיעוד ששימוש מסחרי בשטח הוא מחוץ לייעוד המקורי, אף שהרישיון החוקי עצמו אינו חוסם זאת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗