GPT
E

EVA-CLIP-8B

קוד פתוח

BAAIapache-2.02024-02-05

  • transformers
  • pytorch
  • clip
  • feature-extraction
  • custom_code

מודל חזותי עצום שמחלץ וקטורים מתמונות ומטקסט עם דיוק מרשים במיוחד. הוא מתאים למי שחייב ביצועי זירו-שוט גבוהים בחיפוש או סיווג ולא נבהל ממשקלי ענק.

  • 77טוקנים בהקשר
  • 89.3 GBמשקל הקבצים
  • 1,394הורדות בחודש
  • 51לייקים

מה זה

מדובר בגרסת שמונה מיליארד פרמטרים של משפחת EVA-CLIP, שמטרתה לחבר בין תמונות לשפה ברמת דיוק גבוהה. בזמן שרוב מודלי ה־CLIP הפתוחים נעצרים בנפחים קטנים בהרבה, כאן אימנו מודל ענק על שילוב של שני מיליארד זוגות תמונה וטקסט ממאגרי LAION ו־COYO, כשהוא מגיע מראש אחרי אימון מקדים חזק של מקודד התמונה.

במדדי ההערכה הרשמיים על 27 מבחני סיווג תמונה שונים, המודל מציג דיוק ממוצע של 79.4 אחוזים בזירו-שוט, ובסיווג וידאו על בסיס פריים בודד הוא עומד על 73.6 אחוזים. במשימות אחזור מידע הוא מגיע לציון 86.2. המספרים האלה מראים שהוא מזהה פרטים ויזואליים מורכבים טוב יותר מרוב החלופות הפתוחות בגדלים האלה, בלי שתצטרכו לאמן אותו מחדש על הדאטה שלכם.

מתאים ל

  • חיפוש תמונות לפי טקסט

    אינדוקס מאגרי תמונות גדולים ויצירת וקטורים שמאפשרים שליפה מדויקת לפי שאילתות קצרות.

  • סיווג תמונות ללא אימון

    זיהוי קטגוריות מורכבות על בסיס שמות מחלקות בלבד, עם רמת דיוק גבוהה של 79.4 אחוזים מהקופסה.

  • סינון וסיווג ראשוני של וידאו

    דגימת פריים מרכזי מתוך קטעי וידאו וסיווג התוכן שלהם במהירות לפי תגיות מוגדרות מראש.

איפה זה נופל

המגבלה הכי בולטת היא חלון ההקשר של הטקסט, שעומד על 77 טוקנים בלבד. אם אתם בונים מערכת שצריכה להבין פסקאות ארוכות, תיאורים מפורטים של מוצרים או מסמכים שלמים, הטקסט פשוט ייחתך באכזריות. בנוסף, המפתחים מציינים במפורש שכל תוצאות המדידה במאמר נבדקו עם משקלי PyTorch, וייתכנו הבדלי ביצועים בעבודה עם גרסת Hugging Face, כך שחובה למדוד את הדיוק אצלכם לפני שמסתמכים עליו.

שאלות
נפוצות

האם המודל מבין תיאורי טקסט ארוכים בעברית?

חלון ההקשר מוגבל ל־77 טוקנים בלבד, שזה משפט או שניים קצרים. בנוסף, נתוני האימון מבוססים על מאגרי רשת גלובליים באנגלית בעיקר, כך שעברית ארוכה או מורכבת תיחתך ולא תיתן תוצאות טובות.

האם אפשר להריץ אותו על שרת יחיד עם כרטיס תצוגה רגיל?

במשקל קבצים של קרוב לתשעים גיגה-בייט בדיוק מלא, כרטיס בודד טיפוסי לא יספיק. תצטרכו להשתמש במיזעור, לעבור לחצי דיוק, או להשתמש בחלוקת זיכרון עם DeepSpeed כדי להריץ אותו.

האם כדאי להשתמש בו ישירות דרך Hugging Face?

היוצרים מזהירים במפורש שתוצאות הבנצ'מרק שלהם הושגו עם משקלי PyTorch המקוריים, וגרסת Hugging Face עלולה להניב ביצועים שונים. מומלץ לבדוק את הדיוק מול המאגר הרשמי לפני שילוב במערכת.

איך מריצים

המשקל הכולל של הקבצים מגיע לכמעט תשעים גיגה-בייט בפורמט float32, כך שאי אפשר פשוט לטעון אותו על כרטיס מסך ביתי רגיל. בשביל להריץ אותו בהיסק מקומי תצטרכו שרת עם מאיץ חזק מאוד, או חלוקה על פני כמה כרטיסים באמצעות DeepSpeed ZeRO-3 במידה והזיכרון מוגבל.

הקוד עצמו נתמך דרך ספריית transformers וגם דרך המאגר המקורי ב־GitHub עם משקלי PyTorch ייעודיים. אם אין לכם תשתית ענן ייעודית עם מאיצים מתאימים ותקציב להחזיק אותם דולקים, כנראה שיהיה זול ופשוט בהרבה לפנות לפתרונות API קיימים שמספקים שירותי חילוץ מאפיינים מוכנים.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="BAAI/EVA-CLIP-8B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, ושילוב שלהם במוצרים מסחריים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗