GPT
D

DFN5B-CLIP-ViT-H-14-378

קוד פתוח

appleapple-amlr2023-10-30

  • open_clip
  • pytorch
  • clip

מודל ראייה ושפה שאומן על מאגר נתונים שעבר סינון קפדני במיוחד. הוא מיועד למי שמחפש סיווג תמונות וחיפוש טקסטואלי בדיוק גבוה בהרבה מקליפ רגיל.

  • 77טוקנים בהקשר
  • 7.4 GBמשקל הקבצים
  • 381,315הורדות בחודש
  • 110לייקים

מה זה

אפל לקחה כאן ארכיטקטורת קליפ כבדה ואימנה אותה על חמישה מיליארד צמדי תמונה וטקסט, שסוננו מתוך מאגר גולמי של 43 מיליארד באמצעות רשתות סינון ייעודיות. המודל עבר אימון על רזולוציה בסיסית ולאחר מכן כוונון ברזולוציה גבוהה יותר של 384 על 384 פיקסלים, מה שנותן לו יכולת לראות פרטים קטנים שתמונות מוקטנות רגילות מאבדות.

במבחני ביצועים הוא מגיע לממוצע של כמעט 71 אחוז על פני מגוון רחב של מבחנים, עם דיוק אפס דגימות של מעל 84 אחוז באימג'נט ומעל 96 אחוז בזיהוי חיות מחמד ומזון. המשמעות היא שבמשימות זיהוי סטנדרטיות הוא מבין מה מופיע בפריים בדיוק מרשים, בלי שאימנתם אותו על הקטגוריות שלכם מראש.

מתאים ל

  • חיפוש תמונות לפי טקסט

    אינדוקס קטלוגים גדולים וחיפוש תמונות בעזרת תיאור באנגלית ברמת דיוק גבוהה.

  • סיווג תמונות בלי אימון

    זיהוי פריטים, חיות ומזון בקטגוריות מוגדרות מראש בלי לגעת במשקולות המודל.

  • סינון ומיון מאגרי מידע

    ניקוי דאטה סטים גדולים מתמונות שאינן מתאימות לתיאור הטקסטואלי שמצורף אליהן.

איפה זה נופל

הנקודה החלשה ביותר בולטת במשימות של ספירה והבנת מרחב. במבחן ספירת עצמים הוא קיבל 36 אחוז בלבד, ובאומדן מרחקים צנח ל־20 אחוז, כך שהוא לא יודע להגיד כמה פריטים יש בתמונה או איפה הם עומדים זה ביחס לזה. בנוסף, חלון ההקשר מוגבל ל־77 טוקנים בלבד, מה שחוסם חיפוש לפי תיאורים ארוכים ומורכבים.

שאלות
נפוצות

האם אפשר לתשאל את המודל בעברית?

האימון נעשה על מאגרים ציבוריים באנגלית בלבד. שאילתות בעברית יתנו תוצאות גרועות או חסרות משמעות לחלוטין, ולכן חובה לתרגם את הטקסט לאנגלית לפני שמעבירים אותו למודל.

למה המודל כבד יותר מגרסאות קליפ אחרות?

הוא משתמש בארכיטקטורת ענק של ViT-H וברזולוציית קלט של 378 פיקסלים. הגודל הזה מעלה מאוד את הדיוק, אבל דורש חומרה חזקה וזיכרון וידאו משמעותי גם בשביל תמונה בודדת.

איך מריצים

המשקלים שוקלים 7.4 גיגה בייט ומגיעים במקור מהספרייה הפנימית של אפל, אבל הוסבו ישירות לשימוש עם ספריית אופן קליפ בפייתורץ'. בשביל להריץ אותו בהסקה בלי צווארי בקבוק תצטרכו כרטיס מסך מודרני עם לפחות 16 גיגה זיכרון גרפי, במיוחד בגלל רזולוציית הקלט הגבוהה שמנפחת את צריכת הזיכרון בכל תמונה.

אם אתם צריכים לאנדקס מיליוני תמונות באופן חד פעמי או לבנות מנוע חיפוש פנימי, הרצה מקומית על שרת ענן עם מאיץ ייעודי תהיה זולה ופשוטה יותר מניהול קריאות חוזרות לספק חיצוני, כל עוד מדובר בטקסט קצר ובאנגלית.

pip install -U huggingface_hub
hf download apple/DFN5B-CLIP-ViT-H-14-378

הרישיון

המודל שוחרר תחת רישיון ייעודי של אפל בשם apple-amlr. זה אינו רישיון קוד פתוח חופשי רגיל, ובדרך כלל הוא מגביל את השימוש למחקר בלבד ואוסר הטמעה ישירה במוצרים מסחריים בלי בדיקה משפטית של תנאי ההסכם.

הרישיון המלא בעמוד המודל ↗