GPT
B

beit-base-patch16-224-pt22k-ft22k

קוד פתוח

microsoftapache-2.02022-03-02

  • transformers
  • pytorch
  • jax
  • beit
  • image-classification

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל תמונה שמסווג לתוך 21,841 קטגוריות שונות מתוך מאגר ImageNet-22k. מתאים למי שצריך תיוג רחב ומפורט מאוד ולא רק את אלף המחלקות הרגילות.

  • 788 MBמשקל הקבצים
  • 12,628הורדות בחודש
  • 83לייקים
  • 12שכבות

מה זה

מיקרוסופט אימנו את המודל הזה בארכיטקטורת Vision Transformer עם 12 שכבות, בשיטת אימון שמזכירה את BERT. במקום ללמוד רק לחזות את התגית הסופית מההתחלה, הוא למד לשחזר טוקנים ויזואליים של חלקים מוסתרים בתמונה מתוך מקודד של DALL-E, על גבי 14 מיליון תמונות. לאחר מכן כיווננו אותו ישירות על אותן 21,841 מחלקות.

בניגוד ל־ViT מקורי שמשתמש במיקומים מוחלטים וסומך על טוקן סיווג בודד, כאן יש קידודי מיקום יחסיים והסיווג מתבצע באמצעות ממוצע של כל מצבי ההסתרה של הטלאים. זה נותן ייצוג עשיר יותר של התמונה, שמתאים גם כבסיס לחילוץ מאפיינים למשימות אחרות.

מתאים ל

  • תיוג תמונות מפורט

    זיהוי אובייקטים מתוך מאגר של 21,841 קטגוריות כשאלף מחלקות רגילות לא מספיקות.

  • חילוץ וקטורים לתמונות

    שימוש בשכבות המודל כמקודד שמייצר ייצוג ויזואלי עשיר למודלי המשך.

  • בסיס לאימון מותאם

    החלפת שכבת הפלט האחרונה כדי לאמן מסווג ייעודי על דאטה פנימי שלכם.

איפה זה נופל

הרזולוציה קבועה ונמוכה, 224 על 224 פיקסלים בלבד, כשהתמונה מחולקת לטלאים של 16 על 16. הכרטיס עצמו מציין שהתוצאות הטובות ביותר מתקבלות ברזולוציות גבוהות יותר. אם הפרטים החשובים לזיהוי קטנים או דורשים חדות, הוא יפספס אותם.

בנוסף, הכרטיס נכתב על ידי צוות Hugging Face ולא על ידי מיקרוסופט עצמם, ואין בו מדדי ביצועים ישירים מול מודלים אחרים מלבד הפניה למאמר.

שאלות
נפוצות

מה ההבדל בינו לבין מודל ImageNet רגיל?

מודל רגיל מוגבל לאלף קטגוריות כלליות בלבד. הגרסה הזו אומנה וכווננה על ImageNet-22k, ולכן היא יודעת להבדיל בין אלפי זנים, סוגי חפצים ומושגים ספציפיים בהרבה.

האם המודל תומך בתמונות בכל גודל?

העיבוד דורש שינוי גודל ל־224 על 224 פיקסלים ונרמול של ערוצי הצבע. תמונות ביחס ממדים אחר יימתחו או ייחתכו בהתאם לקוד העיבוד המקדים.

איך מריצים

המודל תופס 788 מגה בייט ורץ דרך ספריית transformers ב־PyTorch. בגלל הגודל הקומפקטי שלו אפשר להריץ אותו בקלות על כרטיס מסך בסיסי או אפילו על מעבד רגיל, בלי תשתית שרתים מורכבת.

אם כל מה שאתם צריכים זה לסווג כמה תמונות בודדות פעם ביום, שירות חיצוני חוסך תחזוקה. אבל עם משקל כזה ודרישות זיכרון נמוכות, הרצה מקומית בתוך הקוד שלכם פשוטה וזולה בהרבה.

from transformers import pipeline

pipe = pipeline("image-classification", model="microsoft/beit-base-patch16-224-pt22k-ft22k")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 788 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור או פתוח. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗