GPT
C

chinese-clip-vit-large-patch14

קוד פתוח

OFA-Sysרישיון לא דווח2022-11-09

  • transformers
  • pytorch
  • chinese_clip
  • zero-shot-image-classification
  • vision

התאמה של ארכיטקטורת CLIP לשפה הסינית על בסיס 200 מיליון זוגות תמונה וטקסט. הוא מיועד למי שצריך חיפוש או סיווג תמונות ישירות מול טקסט בסינית בלי לתרגם קודם לאנגלית.

  • 512טוקנים בהקשר
  • 3.0 GBמשקל הקבצים
  • 29,002הורדות בחודש
  • 37לייקים

מה זה

מדובר בגרסת Large שמחברת בין ViT-L/14 לעיבוד תמונה לבין RoBERTa-wwm-base לעיבוד טקסט. הרעיון זהה ל־CLIP המקורי של OpenAI, אבל במקום להסתמך על אנגלית, המודל הזה אומן מראש על כמאתיים מיליון דוגמאות בסינית ומבין את השפה באופן טבעי.

במבחני שליפת תמונות לפי טקסט כמו MUGE ו־Flickr30K-CN הוא עוקף בעקביות מודלים מקבילים בסינית דוגמת Wukong ו־R2D2, למשל עם דיוק R@1 של 63.0 ב־MUGE ב־Zero-shot לעומת 42.7 של Wukong. בסיווג תמונות כללי ב־Zero-shot הוא מציג תוצאות דומות ל־CLIP המקורי באנגלית ברוב המבחנים, ואף מוביל עליו בחלקם כמו KITTI עם 49.9 לעומת 11.5.

מתאים ל

  • חיפוש תמונות בסינית

    מאפשר לאתר תמונות במאגר ישירות מתוך שאילתות חיפוש טקסטואליות בסינית, ללא צורך בשכבת תרגום.

  • סיווג תמונות ללא אימון

    ממיין תמונות לקטגוריות מוגדרות מראש לפי תוויות טקסט בסינית בשיטת Zero-shot.

  • יצירת וקטורים משותפים

    מייצר וקטורים מתואמים לתמונות ולטקסט בסינית לצורך שמירה במסדי נתונים וקטוריים.

איפה זה נופל

הבעיה המרכזית היא שאין כאן שום תמיכה בעברית, והמודל מוגבל לטקסט בסינית בלבד. אם תזינו שאילתות בשפות אחרות התוצאות ייפגעו קשות. חלון ההקשר מוגבל ל־512 טוקנים, כך שאי אפשר להעביר תיאורי טקסט ארוכים או מורכבים במיוחד.

בנוסף, במבחני Zero-shot מסוימים כמו EuroSAT ו־FGVC הוא מפגר אחרי מודלים בינלאומיים אחרים כמו ALIGN או CLIP המקורי, מה שמראה שאיכות הזיהוי שלו בקטגוריות נישתיות או צילומי לוויין פחות יציבה.

שאלות
נפוצות

האם המודל מבין עברית?

לא. מודל הטקסט אומן על RoBERTa בסינית ומיועד אך ורק לשפה הזו. הזנת עברית תוביל לתוצאות לא רלוונטיות, ואם המערכת שלכם עובדת בעברית תצטרכו לתרגם את השאילתות לסינית לפני הפנייה.

האם אפשר להשתמש במודל במוצר מסחרי?

לא מומלץ להסתמך על זה מיד, מכיוון שבעמוד המודל בריפו לא דווח רישיון כלל. צריך להיכנס למאגר הגיטהאב של OFA-Sys ולוודא תחת איזה רישיון הקוד והמשקלים שוחררו לפני שמשלבים אותו במוצר חי.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.0 גיגה בייט בפורמט float32, והוא נתמך ישירות בספריית transformers תחת הארכיטקטורה ChineseCLIPModel. בשביל להריץ אותו להסקה מקומית תצטרכו כרטיס מסך עם לפחות שמונה גיגה זיכרון כדי להחזיק את המודל ולעבד תמונות בלי חנק.

המפתחים מפנים לקוד בגיטהאב ומציעים שם אפשרות לשימוש ב־API. אם יש לכם שרת עם מאיץ גרפי סביר, עדיף להריץ אותו ישירות מקומית כי מדובר במודל ששוקל 3 גיגה בלבד, מה שמבטיח זמני תגובה קצרים בלי תלות חיצונית.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="OFA-Sys/chinese-clip-vit-large-patch14")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 3.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון לא דווח בעמוד המודל. מבחינה משפטית מדובר בסיכון, כי אי אפשר לדעת אם מותר לשלב אותו במוצר מסחרי, להפיץ אותו ללקוחות או לבצע בו שינויים. לפני שמשלבים אותו בסביבת ייצור, חובה לבדוק את הרישיון במאגר הגיטהאב הרשמי של הפרויקט כדי לוודא שאין מגבלות מסחריות.

הרישיון המלא בעמוד המודל ↗