GPT
C

chinese-clip-vit-base-patch16

קוד פתוח

OFA-Sysרישיון לא דווח2022-11-09

  • transformers
  • pytorch
  • chinese_clip
  • zero-shot-image-classification
  • vision

התאמה ישירה של ארכיטקטורת קליפ לשפה הסינית, מאומנת על 200 מיליון זוגות תמונה וטקסט. מתאים למי שצריך חיפוש או סיווג תמונות מבוסס טקסט בסינית בלי לתרגם קודם לאנגלית.

  • 512טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 191,841הורדות בחודש
  • 134לייקים

מה זה

המודל מחבר בין מקודד התמונות ViT-B/16 לבין מקודד הטקסט RoBERTa-wwm-base כדי לייצר מרחב משותף לתמונות ולתיאורים בסינית. במקום לקחת מודל אנגלי ולתרגם פרומפטים בזמן אמת, הוא אומן ישירות על נתונים מקומיים. הוא יודע להמיר תמונות ומחרוזות סיניות לוקטורים, לחשב ביניהם דמיון, ולבצע סיווג ללא אימון מוקדם על קטגוריות ספציפיות.

במבחני שליפה מבוססי טקסט בסינית כמו MUGE ו־Flickr30K-CN, הוא עוקף בעקביות מודלים מקבילים כמו Wukong ו־R2D2 במצב אפס דגימות. ב־MUGE למשל, מדד השליפה הראשונה שלו עומד על 63.0 מול 49.5 של המתחרה הקרוב, מה שאומר שהוא מוצא תמונה נכונה בניסיון ראשון באחוזים גבוהים בהרבה. בסיווג תמונות כללי הוא מציג ביצועים דומים לקליפ המקורי, עם יתרון קל בחלק מהמבחנים כמו CIFAR100.

מתאים ל

  • חיפוש תמונות בסינית

    מנוע חיפוש פנימי שמאפשר להקליד תיאור בסינית ולשלוף את התמונה המתאימה ממאגר קיים.

  • סיווג ללא אימון

    סיווג תמונות לקטגוריות טקסטואליות בסינית, מתאים לקטלוג מוצרים בלי לבנות סט אימון ייעודי.

  • אינדוקס קטלוגים מקומיים

    יצירת וקטורים מתמונות כדי למצוא התאמות לטקסט סיני ברמת דיוק גבוהה מזו של מודלים מתורגמים.

איפה זה נופל

הוא מיועד ספציפית לסינית, כך שעבור עברית או אנגלית הוא פשוט לא הבחירה הנכונה. בנוסף, במבחני סיווג מסוימים כמו FGVC הוא משיג רק 26.2, שזה נמוך משמעותית מ־33.3 של קליפ המקורי. חובה לבדוק אותו על מאגר התמונות הספציפי שלכם, כי סיווג עדין או זיהוי אובייקטים מורכבים סובל כאן מנפילות ביצועים ביחס למודלים רב-לשוניים חדשים.

שאלות
נפוצות

אפשר להשתמש בו לחיפוש עם טקסט בעברית?

לא. מקודד הטקסט מבוסס על מודל סיני בלבד, והוא לא יבין עברית. אם המערכת שלכם עובדת בעברית תצטרכו מודל רב-לשוני או תרגום מראש, מה שפוגע בדיוק.

כמה זיכרון דרוש כדי להריץ אותו בזמן אמת?

המשקל שלו הוא 1.4 גיגהבייט בפורמט float32. כרטיס מסך פשוט עם 4 עד 6 גיגהבייט זיכרון יספיק לגמרי לחישובי וקטורים מהירים, ואפשר להריץ אותו גם על מעבד רגיל לשאילתות בודדות.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.4 גיגהבייט והוא עובד ישירות דרך ספריית transformers, כך שאפשר להריץ אותו מקומית על כרטיס מסך בסיסי או אפילו על מעבד רגיל בלי להסתבך. חלון ההקשר מוגבל ל־512 טוקנים, שזה די והותר לפסקה קצרה בסינית שמתארת תמונה.

אם אתם צריכים לאנדקס מיליוני תמונות בבת אחת, תרצו כרטיס ייעודי כדי לחשב וקטורים במהירות. לעומת זאת, בשאילתות בודדות של משתמשי קצה, המודל מספיק קטן כדי לרוץ על שרת פשוט בלי עלויות חומרה כבדות ובלי תלות בשירותי ענן חיצוניים.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="OFA-Sys/chinese-clip-vit-base-patch16")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון לא דווח בדף המודל. המשמעות פשוטה: מבחינה משפטית אין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת אם מותר לשלב אותו במוצר בלי לבדוק לעומק את המאגר המקורי בגיטהאב או את תנאי המאמר.

הרישיון המלא בעמוד המודל ↗