GPT
D

DFN5B-CLIP-ViT-H-14

קוד פתוח

appleapple-amlr2023-10-30

  • open_clip
  • pytorch
  • clip

מודל ראייה ושפה מבית אפל שמציע חילוץ מאפיינים וסיווג תמונות ברמת דיוק גבוהה במיוחד. הוא מתאים למי שצריך מודל CLIP חזק שעבר סינון נתונים אגרסיבי במיוחד.

  • 77טוקנים בהקשר
  • 7.4 GBמשקל הקבצים
  • 69,482הורדות בחודש
  • 47לייקים

מה זה

מדובר במודל CLIP בארכיטקטורת ViT-H-14, שאומן על מאגר נתונים של חמישה מיליארד צמדי תמונה וטקסט שסוננו מתוך בריכה ענקית של 43 מיליארד. הרעיון המרכזי כאן הוא שימוש ברשתות סינון ייעודיות כדי לנקות רעשים ומידע לא איכותי מהאינטרנט לפני האימון, מה שמביא לביצועים חריגים ביחס למודלים מקבילים.

במבחני ביצועים הוא מגיע לממוצע של 69.8% דיוק במגוון מבחנים, עם 83.4% דיוק באפס דוגמאות על ImageNet 1k ותוצאות של מעל 95% במאגרים כמו Caltech-101, Stanford Cars וחיות מחמד. ההבדל בינו לבין מודלים ישנים באותו סדר גודל מורגש ישירות ביכולת ההכללה והזיהוי של פרטים חזותיים מורכבים.

מתאים ל

  • חיפוש תמונות לפי טקסט

    אינדוקס מאגרי תמונות גדולים ויצירת וקטורים מדויקים לשליפה מהירה לפי חיפוש חופשי.

  • סיווג ללא אימון מוקדם

    סיווג תמונות לקטגוריות מוגדרות מראש עם דיוק של מעל 83% ב־ImageNet בלי לגעת באימון.

  • סינון וניקוי דאטה

    בדיקת התאמה בין תיאור טקסטואלי לתמונה כדי לסנן נתונים פגומים ממאגרי אימון חדשים.

איפה זה נופל

למרות החוזק בזיהוי עצמים סטנדרטיים, המודל נכשל באופן בולט במשימות שדורשות הבנה מרחבית וספירה. במבחני CLEVR המודדים ספירה ומרחקים הוא מגרד את ה־20% עד 30% דיוק בלבד, וגם במאגרים מורכבים מהעולם האמיתי כמו iWildCam ו־FMoW הוא משיג בקושי 20% דיוק. חלון ההקשר הטקסטואלי מוגבל ל־77 טוקנים בלבד, כך שאי אפשר להעביר לו תיאורים ארוכים, והוא לא מתאים למשימות הבנה לוגית של סצנות מורכבות.

שאלות
נפוצות

האם המודל תומך בטקסט בעברית?

האימון נעשה על נתוני רשת מסוננים שהם בעיקר באנגלית, וחלון הטקסט קצר מאוד ועומד על 77 טוקנים. הוא לא אומן במפורש על עברית, ולכן ניסיון לתשאל אותו בעברית ייתן תוצאות חלשות מאוד ביחס לאנגלית.

כמה זיכרון וידאו צריך בשביל להריץ אותו בפועל?

המשקלים עצמם שוקלים 7.4 גיגה-בייט ונשמרים בדיוק מלא. לצורך הרצת מודל בודד והזנת אצוות תמונות קטנות תצטרכו כרטיס עם לפחות 12 עד 16 גיגה-בייט זיכרון פנוי.

איך מריצים

את המשקלים מריצים ישירות באמצעות ספריית open_clip בפייתון, לאחר שהומרו מגרסת ה־JAX המקורית של אפל לפורמט PyTorch. הקבצים שוקלים 7.4 גיגה-בייט בדיוק של float32, ולכן תצטרכו כרטיס מסך עם לפחות 12 עד 16 גיגה-בייט זיכרון כדי לטעון אותם ולהריץ הסקה בצורה חלקה.

אם יש לכם כרטיס מסך מתאים בשרת עצמאי, ההרצה המקומית פשוטה ומהירה מאוד. למי שאין תשתית כרטיסי מסך זמינה או שמחפש רק לתייג כמה תמונות פה ושם, עדיף לפנות לפתרונות ענן או שרתי היקש לפי דרישה במקום להחזיק חומרה כבדה דולקת.

pip install -U huggingface_hub
hf download apple/DFN5B-CLIP-ViT-H-14

הרישיון

המודל מופץ תחת רישיון מחקר ייעודי של אפל בשם apple-amlr. הרישיון הזה בדרך כלל מגביל שימוש מסחרי ישיר ומיועד למטרות אקדמיות ומחקר פנימי בלבד. אם אתם בונים מוצר מסחרי שנועד ללקוחות, אי אפשר להטמיע את המשקלים האלה ישירות בלי לבדוק לעומק את תנאי הרישיון המשפטיים של אפל.

הרישיון המלא בעמוד המודל ↗