GPT
M

mit-b0

קוד פתוח

nvidiaother2022-03-02

  • transformers
  • pytorch
  • tf
  • segformer
  • image-classification

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מקודד ראייה זעיר ששוקל פחות מ־28 מגה-בייט ומסווג תמונות ישירות מתוך ספריית transformers. מפתחים בוחרים בו בעיקר כבסיס קל לאימון מודלים של סגמנטציה.

  • 27.7 MBמשקל הקבצים
  • 98,841הורדות בחודש
  • 44לייקים

מה זה

מדובר בארכיטקטורת שנאי היררכית שפותחה על ידי אנבידיה כחלק מפרויקט SegFormer, בגרסה הקטנה ביותר שלו שנקראת b0. הקובץ הנוכחי מכיל רק את המקודד שאומן מראש על ImageNet-1k, בלי ראש הפענוח הייעודי של סגמנטציה מלאה. בפועל הוא יכול לתפקד כמסווג תמונות רגיל לאלף המחלקות של ImageNet, אבל המטרה המקורית שלו שונה לגמרי.

הייחוד של המבנה ההיררכי הזה הוא היכולת לייצר ייצוגים ברזולוציות שונות, תכונה קריטית לזיהוי גבולות מדויקים של עצמים. עם זאת, היות שמדובר בגרסת הבסיס המינימלית, הוא מקריב לא מעט דיוק לטובת גודל קובץ מזערי של 27.7 מגה-בייט בלבד. מי שמחפש פתרון סגמנטציה מוכן לקצה יצטרך לחבר לו ראש פענוח מתאים או לחפש גרסה שכבר עברה כוונון מלא למשימה הספציפית.

מתאים ל

  • בסיס לאימון סגמנטציה

    מקודד קל משקל שאפשר לחבר לו ראש פענוח ולאמן אותו על מאגר תמונות ייעודי.

  • סיווג תמונות במכשירי קצה

    משקל של 27.7 מגה-בייט מאפשר הרצה מהירה גם על מעבדים חלשים בלי כרטיס מסך.

  • הערכת תכונות ראשונית

    חילוץ ייצוגים רב-שכבתיים מתמונות לשימוש במודלים קטנים נוספים בצינור הנתונים.

איפה זה נופל

הקובץ הזה אינו כלי סגמנטציה מוכן, למרות שהוא מגיע מתוך מחקר SegFormer. אין כאן ראש פענוח לזיהוי פיקסלים, אלא מקודד בלבד שמתאים להערכת תמונות כללית או כנקודת מוצא לאימון. כמו כן, צוות הפיתוח המקורי של אנבידיה לא כתב עבורו כרטיס מודל מסודר, ולכן חסרים נתונים מתועדים על הטיות בדאטה, מגבלות ספציפיות או מדדי ביצועים מדויקים על משימות סיווג.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות לסגמנטציה של תמונות?

לא, המאגר הזה מכיל אך ורק את המקודד הראשוני שאומן על ImageNet. כדי לבצע סגמנטציה צריך לחבר לו ראש פענוח מתאים ולאמן אותו, או להוריד מודל SegFormer שעבר כוונון מלא.

האם המודל דורש כרטיס מסך של אנבידיה כדי לעבוד?

ממש לא. הוא שוקל פחות מ־28 מגה-בייט וירוץ בקלות על כל מעבד רגיל דרך ספריית transformers, בלי תלויות חומרה כבדות.

איך מריצים

טוענים את המודל ישירות בפייתון באמצעות ספריות transformers ו־PIL, עם SegformerForImageClassification והמעבד SegformerImageProcessor. מעבירים תמונה, מחלצים את הלוגיטים, והאינדקס הגבוה ביותר נותן את המחלקה המזוהה מתוך אלף האפשרויות של ImageNet.

במשקל כולל של פחות משלושים מגה-בייט ובדיוק float32, אין שום צורך במעבדים גרפיים חזקים או שרתים ייעודיים כדי להריץ הסקה. הוא ירוץ בקלות על כל מעבד מרכזי בסיסי, במחשב נייד או במכשיר קצה חלש. אין שום סיבה הגיונית לשלם ל־API חיצוני על הסקה בגודל כזה, אלא אם כן אתם מתכננים לאמן אותו מחדש על דאטה-סט ענק של סגמנטציה ואתם זקוקים למשאבי חישוב כבדים לצורך האימון עצמו.

from transformers import pipeline

pipe = pipeline("image-classification", model="nvidia/mit-b0")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 27.7 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ומפנה למאגר הקוד של SegFormer בגיטהאב. מי שרוצה להטמיע את המשקלים האלה במוצר מסחרי חייב להיכנס עצמאית לקישור המקורי ולקרוא את תנאי הרישיון המדויקים של אנבידיה לפני תחילת העבודה.

הרישיון המלא בעמוד המודל ↗