GPT
A

aimv2-large-patch14-224

קוד פתוח

appleapple-amlr2024-10-29

  • transformers
  • jax
  • safetensors
  • aimv2_vision_model
  • image-feature-extraction

מודל ראייה של אפל שמחלץ מאפיינים מתמונות ומציג ביצועים עדיפים על פתרונות מוכרים כמו קליפ ודינו. הוא מתאים למי שבונה חיפוש ויזואלי או זיהוי אובייקטים ומחפש אלטרנטיבה חזקה בגודל שפוי.

  • 309Mפרמטרים
  • 3.5 GBמשקל הקבצים
  • 2,628הורדות בחודש
  • 62לייקים

מה זה

מדובר באנקודר ויזואלי שמבוסס על ארכיטקטורה של 24 שכבות ומתמחה בחילוץ וקטורים מתמונות. אפל אימנה את סדרת המודלים הזו באמצעות מטרה אוטורגרסיבית מולטימודלית. המטרה הזו מאפשרת למודל לייצר ייצוגים עמוקים של תוכן התמונה בלי להסתבך בשיטות אימון כבדות ומסורבלות יותר.

לפי הממצאים של החוקרים, הארכיטקטורה עוקפת מתחרים וותיקים כמו קליפ של אופן איי איי וסיגליפ ברוב מבחני ההבנה המולטימודלית. בנוסף, היא מנצחת את דינו שתיים במשימות של זיהוי אובייקטים באוצר מילים פתוח והבנת ביטויים שמפנים לאזורים ספציפיים בתמונה. כשמחפשים מנוע חזק לשכבת הייצוג הויזואלי, מדובר בשדרוג מורגש על פני ארכיטקטורות קודמות.

מתאים ל

  • חיפוש תמונות לפי דמיון

    חילוץ וקטורים מדויקים שמאפשרים להשוות בין פריטים ויזואליים במאגר גדול במהירות.

  • זיהוי אובייקטים פתוח

    שכבת ייצוג מקדימה לזיהוי פריטים מגוונים בלי תלות במחלקות שהוגדרו מראש.

  • הבנת ביטויים מרפררים

    קישור בין תיאור מילולי לאזורים מוגדרים בתוך התמונה ברמת דיוק גבוהה.

איפה זה נופל

המודל מוגבל לרזולוציה קבועה של 224 על 224 פיקסלים בחלוקה לטלאים של 14 על 14. תמונות עם פרטים זעירים או טקסט קטן יאבדו מידע קריטי במהלך ההתאמה לגודל הזה. בנוסף, הוא פולט רק וקטורים ולא מייצר טקסט או תיאורים בעצמו. הטעינה מחייבת הרצת קוד צד שלישי לא מוכר בסביבה שלכם, מה שעלול להדליק נורות אדומות בצוותי אבטחה.

שאלות
נפוצות

האם המודל יכול לכתוב לי תיאור של מה שרואים בתמונה?

לא. זה אנקודר בלבד שמייצר ייצוגים וקטוריים מספריים. כדי לקבל טקסט חזרה תצטרכו לחבר אותו למודל שפה או להשתמש בו בתוך רשת גדולה יותר.

האם חייבים כרטיס מסך יקר בשביל להריץ אותו?

ממש לא. 309 מיליון פרמטרים זה משקל קל בעולם הלמידה העמוקה. כרטיס מסך פשוט או אפילו מעבד מודרני יריצו אותו בקלות.

איך מריצים

המודל כולל כ־309 מיליון פרמטרים ומשקל קבצים של 3.5 גיגהבייט. אפשר להריץ אותו בלי בעיה על כרטיס מסך בסיסי עם 8 גיגה זיכרון, וגם על מעבד רגיל אם עובדים באצוות קטנות. הוא נתמך ישירות בספריית טרנספורמרס דרך פייתורץ' וג'קס, אך דורש הפעלה עם הרשאת קוד מרחוק כדי לטעון את הארכיטקטורה הייעודית.

אם יש לכם שרת מקומי עם מאיץ גרפי פשוט, אין סיבה לשלם על קריאות שירות חיצוניות. הגודל הזה רץ מהר ומאפשר לעבד כמויות גדולות של תמונות מקומית בעלות נמוכה.

from transformers import pipeline

pipe = pipeline("image-feature-extraction", model="apple/aimv2-large-patch14-224")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון המחקר הייעודי של אפל, אפל איי אם אל אר. הרישיון הזה מגביל לרוב את השימוש למחקר ובדיקות ולא מאפשר שילוב ישיר במוצרים מסחריים. לפני שמכניסים אותו למערכת פעילה, חייבים לבדוק את תנאי הרישיון המדויקים מול המחלקה המשפטית.

הרישיון המלא בעמוד המודל ↗