GPT
M

metaclip-b32-400m

קוד פתוח

facebookcc-by-nc-4.02023-10-07

  • transformers
  • pytorch
  • clip
  • zero-shot-image-classification
  • vision

שחזור פתוח של מנגנון הסינון מאחורי המאגר של CLIP, שאומן על 400 מיליון דוגמאות מ־CommonCrawl. הוא מתאים למי שרוצה צימוד טקסט ותמונה בלי להסתמך על מערכי הנתונים הסגורים של OpenAI.

  • 1.1 GBמשקל הקבצים
  • 2,344הורדות בחודש
  • 46לייקים

מה זה

מטא ניסו לפצח במאמר שלהם איך OpenAI באמת בנו את מערך הנתונים של CLIP המקורי, משהו שמעולם לא שוחרר בקוד פתוח. המודל הזה הוא תוצאה של אימון ארכיטקטורת ViT-B/32 סטנדרטית על 400 מיליון צמדי תמונה וטקסט שנאספו לפי שיטת הסינון שהם פיתחו על גבי CommonCrawl.

הוא ממפה תמונות ומחרוזות טקסט לאותו מרחב וקטורי. בפועל, זה נותן יכולת לסווג תמונות בלי לאמן מודל ייעודי מראש, או לבצע חיפוש סמנטי של תמונות באמצעות תיאור טקסטואלי חופשי וההפך.

בגודל הזה של Base עם פאצ'ים של 32, הוא מיועד להיות נקודת מוצא קלה ומהירה ולא מודל כבד שמחפש פרטים זעירים. אין כאן הפתעות ארכיטקטוניות מול CLIP המקורי, אלא הבדל שנובע בעיקר מאיכות וסינון הדאטה שנכנס לאימון.

מתאים ל

  • סיווג תמונות מהיר

    מאפשר לסווג תמונות לפי תוויות טקסט חופשיות בלי צורך באימון מוקדם על קטגוריות ספציפיות.

  • חיפוש תמונות בטקסט

    הווקטורים המשותפים מתאימים לשליפת תמונות מתוך מאגר לפי תיאור מילולי פשוט.

  • מחקר על דאטה פתוח

    הוא נבנה כבסיס השוואה פתוח שמשחזר את שיטות הדאטה של OpenAI ללא המסתורין סביב האימון.

איפה זה נופל

הצוות המקורי ששחרר את המודל לא טרח לכתוב כרטיס מודל מסודר, ודף המודל נכתב על ידי אנשי Hugging Face. זה אומר שאין תיעוד מפורט על הטיות ספציפיות, מגבלות שפה מעבר לאנגלית, או מקרי קצה שבהם הסינון נכשל. בנוסף, חלוקה לפאצ'ים של 32 פיקסלים מאבדת פרטים עדינים בתמונות מורכבות בהשוואה לדגמים עם רזולוציה עדינה יותר.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה במוצר מסחרי?

לא. הרישיון המוגדר הוא cc-by-nc-4.0, שאינו מתיר שימוש מסחרי מכל סוג. אם המטרה היא מוצר שמייצר הכנסה או שירות לחברה, צריך לחפש מודל עם רישיון מתירני יותר כמו MIT או Apache.

האם המודל מבין טקסט בעברית לחיפוש תמונות?

האימון התבסס על CommonCrawl בשיטות ששחזרו את CLIP המקורי, שמתמקד בעיקר באנגלית. לא מומלץ לבנות עליו חיפוש בעברית בלי לבדוק קודם תרגום של השאילתות לאנגלית.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.1 גיגה בייט בפורמט float32, שזה קל מאוד. אפשר להריץ אותו בלי בעיה על מעבד רגיל, ועל כרטיס מסך ביתי בסיסי הוא ירוץ במהירות גבוהה מאוד דרך ספריית transformers.

בגלל המשקל הקטן, אין שום סיבה אמיתית לשלם על קריאות API חיצוניות אם יש לכם שרת מינימלי משלכם. הגודל הזה מיועד לריצה מקומית פשוטה, כשרק צריך לקחת בחשבון את חלוקת הקבצים בעת ההורדה הראשונית.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="facebook/metaclip-b32-400m")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0. זה אומר שמותר להוריד, לחקור, לשנות ולהריץ את המודל לצרכים אקדמיים, פנימיים או אישיים, אבל אסור לחלוטין להשתמש בו במוצר מסחרי, באפליקציה בתשלום או כחלק מפעילות עסקית מניבה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗