GPT
V

vit-mae-base

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • vit_mae

בסיס ראייה ממוחשבת שאומן להשלים פיקסלים חסרים מתמונות חתוכות. הוא מיועד למי שרוצה נקודת פתיחה יעילה לאימון מודל סיווג על נתונים משלו.

  • 112Mפרמטרים
  • 1.3 GBמשקל הקבצים
  • 48,168הורדות בחודש
  • 40לייקים

מה זה

פייסבוק אימנו את המודל הזה כטרנספורמר שמחלק תמונה למקטעים קבועים, מעלים שבעים וחמישה אחוזים מהם, ומלמד את המערכת לשחזר את הפיקסלים המקוריים שנמחקו. התוצאה של השיטה הזו היא מקודד שמבין היטב מבנה ויזואלי בלי שאי פעם תייגו עבורו תמונות באופן ידני.

המשמעות בפועל היא שזהו מודל קדם אימון נטו. הוא לא מגיע עם רשימת תוויות מוכנה ולא יגיד לכם אם יש חתול בתמונה, אלא מספק ייצוגים מתמטיים של המידע הוויזואלי. כדי להפיק ממנו ערך אמיתי, מלבישים עליו שכבה לינארית ומאמנים אותה על משימה ספציפית שלכם.

מתאים ל

  • בסיס לאימון מסווג תמונות

    מלבישים שכבה לינארית על המקודד ומאמנים על נתונים שלכם כדי לקבל סיווג מדויק.

  • חילוץ מאפיינים ויזואליים

    הפקת וקטורים שמייצגים תמונות לצורך חיפוש דמיון ויזואלי או קלסטרינג.

  • מחקר על שחזור תמונה

    בדיקת יכולות השלמת פרטים חסרים על בסיס רשת שרואה רבע מהתמונה בלבד.

איפה זה נופל

המודל מגיע ישירות משלב קדם האימון ולא עבר התאמה למשימה מוגדרת. אי אפשר לקבל ממנו תוצאות סיווג מוכנות לשימוש בלי להוסיף שכבה ולאמן אותה על נתונים מתויגים. בנוסף, מי שכתבו את כרטיס המודל הם אנשי הצוות של Hugging Face ולא החוקרים שפיתחו אותו במקור, כך שאין כאן מידע רשמי על דאטהסט האימון המדויק או מדדי ביצועים רשמיים מעבר למאמר המקורי.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות כדי לזהות חפצים בתמונות?

לא. המודל מחזיר שחזור פיקסלים וייצוגים פנימיים, לא תוויות. כדי לסווג תמונות צריך לאמן שכבה עליונה על גביו או להוריד גרסה שעברה פיין טיונינג למשימה הרצויה.

האם אני חייב כרטיס מסך חזק כדי להריץ אותו?

לא בשביל הרצה של תמונות בודדות. עם 112 מיליון פרמטרים ומשקל קבצים קטן, אפשר להריץ אותו גם על מעבד רגיל, אם כי לאימון מחדש תמיד עדיף כרטיס מסך בסיסי.

איך מריצים

טוענים את המעבד והמשקלים ישירות דרך ספריית transformers בפייתון ומעבירים תמונה כדי לקבל את השחזור או הייצוג. המשקל של הקבצים עומד על 1.3 ג'יגה בייט וגודל המודל הוא כ־112 מיליון פרמטרים, כך שכל כרטיס מסך בסיסי או אפילו מעבד רגיל יריצו אותו בלי מאמץ מיוחד.

אין סיבה לשלם ל־API חיצוני רק כדי להריץ משקל כזה קל. הוא רץ מקומית בלי בעיה, אבל אם המטרה היא סיווג תמונות מיידי בפרודקשן, חפשו גרסה שכבר עברה פיין טיונינג במקום להרים סביבת אימון מאפס.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/vit-mae-base")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש פעולה מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולהפיץ אותו בתוך מוצר סגור, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗