GPT
M

metaclip-h14-fullcc2.5b

קוד פתוח

facebookcc-by-nc-4.02023-10-09

  • transformers
  • pytorch
  • safetensors
  • clip
  • zero-shot-image-classification

גרסת ענק של CLIP שאומנה על 2.5 מיליארד דוגמאות מ־CommonCrawl כדי לשחזר את הדאטה הסודי של OpenAI. מתאימה למי שצריך מודל חזק במיוחד לחיפוש תמונות לפי טקסט במחקר.

  • 986Mפרמטרים
  • 11.0 GBמשקל הקבצים
  • 6,081הורדות בחודש
  • 49לייקים

מה זה

מטא ניסו לפצח כאן את הדרך שבה OpenAI בנו את הדאטה המקורי של CLIP, בלי להשאיר את תהליך הסינון סגור. הם לקחו 2.5 מיליארד צמדי תמונה וטקסט מהרשת ואימנו עליהם ארכיטקטורת Huge עם חלוקה לטלאים של 14 פיקסלים. התוצאה היא מודל שמייצר מרחב משותף לתמונות ולמלל, בלי צורך באימון מחדש על קטגוריות ספציפיות.

ההבדל מול גרסאות קטנות יותר הוא בעיקר רמת הדיוק בפרטים עדינים בתמונה ובטקסטים מורכבים. עם קרוב למיליארד פרמטרים, הוא מיועד למצבים שבהם מודלים בסיסיים מפספסים קשרים סמנטיים עמוקים, אבל המחיר מגיע מיד בצריכת הזיכרון.

מתאים ל

  • סיווג תמונות ללא אימון

    זיהוי קטגוריות חדשות של תמונות לפי תיאור טקסט חופשי, בלי צורך לתייג דאטה מראש.

  • מנוע חיפוש תמונות לפי טקסט

    מיפוי תמונות ושאילתות לאותו וקטור כדי למצוא תמונה מתאימה לפי תיאור מילולי מורכב.

  • מחקר על דאטה פתוח

    בדיקת ההשפעה של סינון CommonCrawl בהשוואה לתוצאות הסגורות של OpenAI.

איפה זה נופל

הצוות ששחרר את המודל לא טרח אפילו לכתוב לו כרטיס מודל מסודר, ואנשי Hugging Face מילאו את החסר בעצמם. אין כאן שום מידע על הטיות ספציפיות בדאטה העצום של CommonCrawl, שום מדדי ביצועים רשמיים בעמוד, ואין תיעוד לגבי עבודה עם שפות שאינן אנגלית. לפני שאתם בונים עליו, תצטרכו למדוד בעצמכם איך הוא מתמודד עם טקסט מקומי ומקרים מורכבים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה באפליקציה מסחרית?

לא. הרישיון הוא cc-by-nc-4.0 והוא אוסר שימוש מסחרי מכל סוג. אם אתם בונים מוצר למכירה, תצטרכו לחפש חלופה ברישיון פתוח לחלוטין כמו אפאצ'י או MIT.

האם המודל יזהה טקסט בעברית בתוך תמונות או בשאילתות?

האימון נעשה על CommonCrawl באנגלית ואין שום תיעוד רשמי בכרטיס לתמיכה בשפות אחרות. אל תבנו על עברית בלי להריץ בדיקה ידנית של הוקטורים מראש.

איזה כרטיס מסך צריך כדי להריץ אותו?

המודל שוקל 11 גיגה בייט בדיוק float32. תצטרכו כרטיס עם לפחות 16 גיגה בייט VRAM להסקה פשוטה, ועדיף 24 גיגה בייט כדי לעבוד בנוחות עם אצוות של תמונות.

איך מריצים

כדי להריץ אותו דרך transformers צריך לקחת בחשבון משקל של 11 גיגה בייט בפורמט float32. זה אומר שכרטיס מסך פשוט יחנוק את התהליך, ותצטרכו GPU ייעודי עם לפחות 16 עד 24 גיגה בייט זיכרון רק כדי לטעון אותו ולבצע הסקת מסקנות מהירה.

אם אתם רק בודקים רעיון או מחפשים פתרון נקודתי לחיפוש תמונות, להרים שרת ייעודי למפלצת כזו יעלה לא מעט. במקרים כאלה עדיף לבדוק אם שירות מנוהל חיצוני מספק את הסחורה לפני שמתחייבים לחומרה כבדה.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="facebook/metaclip-h14-fullcc2.5b")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר באופן חד משמעי שאין לכם אישור להשתמש בו לצרכים מסחריים. אפשר לחקור איתו, ללמוד אותו ולהריץ ניסויים פנימיים, אבל אסור לשלב אותו בשום מוצר שנמכר ללקוחות או מייצר הכנסה ישירה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗