GPT
C

CLIP-ViT-B-16-laion2B-s34B-b88K

קוד פתוח

laionmit2023-01-03

  • open_clip
  • safetensors
  • zero-shot-image-classification

יש כאן גם סקירה על LAION עצמו.

מימוש פתוח של ארכיטקטורת קליפ שאומן על שני מיליארד צמדי תמונה וטקסט. הוא מתאים למי שרוצה סיווג ואחזור תמונות בלי לשלם על קריאות שרת חיצוניות.

  • 1.1 GBמשקל הקבצים
  • 515,867הורדות בחודש
  • 39לייקים

מה זה

מדובר במודל ראייה ושפה שממפה תמונות וטקסט לאותו מרחב וקטורי. המטרה העיקרית שלו היא סיווג תמונות באפס דוגמאות מראש, אחזור הדדי בין טקסט לתמונה, ושימוש כבסיס לחילוץ מאפיינים או הנחיית מודלי יצירת תמונה. הוא אומן באמצעות ספריית open_clip על גבי תת המאגר האנגלי של LAION-5B, שכולל שני מיליארד דוגמאות שנאספו מהרשת הציבורית.

במבחן התוצאה הוא מציג דיוק של 70.2 אחוזים במדד zero-shot top-1 על ImageNet-1k. המספר הזה אומר שבשבע מתוך עשר תמונות מתוך אלף קטגוריות שונות, ההשערה הראשונה שלו מדויקת לחלוטין בלי שהוא עבר כוונון ייעודי למאגר הזה. הבדיקות הרחבות שלו נשענות גם על VTAB פלוס למשימות סיווג, ועל COCO ופליקר למשימות אחזור.

מתאים ל

  • סיווג תמונות ללא אימון

    מזהה קטגוריות מוגדרות מראש באנגלית בדיוק של 70.2 אחוזים על ImageNet בלי לגעת במשקלים.

  • מנוע חיפוש טקסט לתמונה

    מאחזר תמונות לפי תיאור טקסט חופשי באנגלית מתוך מאגר מקומי, ללא תלות ברשת.

  • חילוץ וקטורים והנחיה

    משמש כבסיס קל משקל של 1.1 גיגה בייט לחילוץ מאפיינים ויזואליים וצימוד למודלי יצירה.

איפה זה נופל

המודל אומן ונבדק באנגלית בלבד. אם תזינו לו טקסט בעברית לחיפוש או לסיווג, הוא לא ידע מה לעשות איתו בלי תרגום מוקדם. מעבר לזה, הדאטהסט ששימש לאימון נאסף מהרשת בלי סינון עמוק, ולכן הוא כולל תוכן לא הולם והטיות בעייתיות.

יוצרי המודל מזהירים מפורשות שכל פריסה מבצעית, מסחרית או לא, אינה מומלצת בלי בדיקות קפדניות ומערכת קטגוריות סגורה. יש להימנע לחלוטין משימוש בו למעקב או זיהוי פנים, והביצועים שלו משתנים מאוד בהתאם לטקסונומיה שתגדירו לו.

שאלות
נפוצות

האם המודל מבין עברית?

לא. המודל אומן על תת מאגר באנגלית בלבד ולא נבדק בשפות אחרות. אם תרצו להשתמש בו עבור תגיות או חיפושים בעברית, תצטרכו לתרגם את הטקסט לאנגלית לפני שמעבירים אותו למודל.

האם כדאי להטמיע אותו ישר במערכת פרודקשן?

כרטיס המודל ממליץ מפורשות שלא לעשות את זה בלי בדיקות עומק. מאגר האימון לא היה מסונן, והרגישות של המודל לניסוח הקטגוריות גבוהה מאוד, כך שחובה לבדוק אותו על הנתונים שלכם לפני שחרור למשתמשים.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.1 גיגה בייט בלבד, כך שאין שום צורך במערך חומרה כבד. כרטיס מסך ביתי בסיסי ביותר, ואפילו מעבד מרכזי רגיל, יריצו אותו בלי בעיה למשימות הסקה. מריצים אותו ישירות דרך ספריית open_clip בקוד פייתון מקומי.

עם גודל כזה של קבצים, אין היגיון לשלם לספק ענן על שירות מנוהל או API חיצוני. אתם פשוט מורידים את המשקלים למכונה מקומית או לשרת קיים ומריצים שאילתות ישירות, בלי תקורת רשת ובלי תלות בצד שלישי.

pip install -U huggingface_hub
hf download laion/CLIP-ViT-B-16-laion2B-s34B-b88K

הרישיון

המודל מופץ תחת רישיון MIT. מבחינה משפטית הרישיון מתיר שימוש מסחרי, שינוי, הפצה ושילוב במוצרים סגורים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. יחד עם זאת, כרטיס המודל עצמו ממליץ להגביל את השימוש למחקר בלבד בגלל אופי הנתונים שעליהם הוא אומן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗