GPT
Y

yolos-small

קוד פתוח

hustvlapache-2.02022-04-26

  • transformers
  • pytorch
  • safetensors
  • yolos
  • object-detection

זהו Vision Transformer קל משקל לזיהוי אובייקטים, שמבוסס על ארכיטקטורת רצף פשוטה של ViT במקום רשתות קונבולוציה. הוא מתאים למי שמחפש פתרון קומפקטי מבוסס שנאי תמונה שרץ ישירות דרך transformers.

  • 31Mפרמטרים
  • 234 MBמשקל הקבצים
  • 756,251הורדות בחודש
  • 98לייקים

מה זה

מדובר במודל זיהוי אובייקטים שלוקח ארכיטקטורת Vision Transformer סטנדרטית ומאמן אותה ישירות למשימת זיהוי בעזרת שיטת הלוס של DETR. בניגוד למודלים מסורתיים שמשלבים שכבות קונבולוציה ייעודיות לעיבוד מקדים, המודל הזה מתייחס לתמונה כאל רצף טוקנים בודד, עם 100 שאילתות אובייקט שמחפשות עצמים במקביל בעזרת התאמה הונגרית.

הוא עבר אימון מקדים של 200 תקופות על ImageNet-1k, ואז כוונון של 150 תקופות על COCO 2017. מבחינת ביצועים, גרסת ה־small הזו מגיעה לציון של 36.1 AP על סט הוולידציה של COCO. לשם השוואה, גרסת ה־base מגיעה ל־42 AP, כך שאתם מוותרים כאן על לא מעט דיוק בשביל לחסוך במשאבים ולהישאר סביב 31 מיליון פרמטרים בלבד.

מתאים ל

  • זיהוי אובייקטים על מעבדים

    המשקל הקל של 234 מגה בייט מאפשר להריץ אותו ישירות על מעבדי CPU בלי צורך בכרטיס מסך ייעודי.

  • פיתוח ובדיקת רעיונות ב־ViT

    בסיס נוח לבדיקת ארכיטקטורות טרנספורמר לתמונה בזכות תאימות מלאה לספריית transformers.

  • סיווג ותחימת פריטים ממאגר COCO

    זיהוי ישיר של קטגוריות עצמים מוכרות מתוך 118 אלף תמונות האימון בלי צורך באימון מחדש.

איפה זה נופל

הפשרה העיקרית כאן היא הדיוק, ציון של 36.1 AP אומר שהוא יפספס אובייקטים קטנים או חופפים הרבה יותר מגרסאות גדולות יותר. מעבר לכך, המודל מוגבל למבנה קבוע של 100 שאילתות לתמונה, מה שאומר שאם יש לכם פריים עמוס במיוחד עם יותר ממאה עצמים, חלקם פשוט יישארו בחוץ. אם אתם בונים מערכת קריטית שדורשת רמת אמינות גבוהה בזיהוי מורכב, הגרסה הזו כנראה לא תספיק לכם.

שאלות
נפוצות

איך המודל מתמודד עם תמונות שיש בהן מעט מאוד עצמים?

הוא מייצר תמיד 100 תחזיות במקביל, גם אם יש בתמונה רק עצם אחד. אלגוריתם ההתאמה שמשמש באימון מקצה את רוב השאילתות למצב של חוסר אובייקט, כך שבפועל מסננים את התוצאות הריקות לפי ספי ביטחון של הלוגיטים.

האם כדאי לבחור בו על פני גרסת ה־base של YOLOS?

זה תלוי במגבלות החומרה שלכם. גרסת ה־base מגיעה ל־42 AP לעומת 36.1 בגרסה הזו, שזה הבדל מורגש בדיוק, אבל גרסת ה־small קטנה וקלה יותר להרצה בסביבות מוגבלות.

איך מריצים

המשקל הכולל של הקבצים עומד על 234 מגה בייט בלבד, כך שלא צריך שרת כבד כדי להרים אותו. הוא רץ ישירות מתוך ספריית transformers באמצעות PyTorch עם מחלקות ה־YolosFeatureExtractor וה־YolosForObjectDetection, ויעבוד חלק גם על מעבד רגיל או מאיץ גרפי פשוט בלי צורך בתשתית ייעודית מורכבת.

בגודל כזה אין שום סיבה אמיתית לשלם על API חיצוני. אתם פשוט טוענים את המשקלים מקומית ומקבלים לוגיטים ותיבות תוחמות תוך רגע, בלי תלויות ברשת ובלי עלויות פר קריאה.

from transformers import pipeline

pipe = pipeline("object-detection", model="hustvl/yolos-small")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 234 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש פעולה כמעט מלא. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו הלאה בחינם או בתשלום. התנאי המרכזי הוא שמירה על הודעת הרישיון המקורית והצהרה על שינויים שביצעתם, בלי לדרוש מכם לחשוף את הקוד של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗