GPT
D

dino-vitb16

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • vit
  • image-feature-extraction

מחלץ וקטורים מתמונות שלמד לבד לגמרי על מיליון תמונות בלי תגיות. הוא מתאים למי שבונה חיפוש ויזואלי או רוצה בסיס איכותי לסיווג בלי לתייג מחדש.

  • 657 MBמשקל הקבצים
  • 492,125הורדות בחודש
  • 112לייקים
  • 12שכבות

מה זה

מדובר במודל ראייה ממוחשבת מבוסס שנאי של פייסבוק, שמשתמש בשיטת אימון עצמי בשם DINO על מאגר ImageNet-1k. התמונות נחתכות לריבועים קטנים של 16 על 16 פיקסלים ברזולוציה בסיסית של 224 על 224, ומעובדות דרך 12 שכבות אנקודר בדיוק float32. אין כאן שכבת סיווג סופית שמחזירה שמות של עצמים.

במקום לנחש מה יש בתמונה, הוא מייצר ייצוג מספרי עשיר של התוכן שלה דרך טוקן ה־CLS. הרעיון של DINO הוא שהייצוגים האלה שומרים על מידע מבני וסמנטי חזק מאוד, מה שמאפשר לקחת את הוקטורים ולהשתמש בהם למשימות המשך כמו חלוקת תמונה לחלקים, מציאת דמיון או אימון מסווג ליניארי פשוט מעליהם.

מתאים ל

  • חיפוש תמונות דומות

    חילוץ וקטור מייצג מכל תמונה ושמירתו במסד נתונים וקטורי להשוואת מרחק.

  • בסיס לסיווג מותאם

    אימון שכבה ליניארית אחת בלבד מעל טוקן ה־CLS על דאטה מתויג קטן.

  • חלוקת תמונה למקטעים

    שימוש בתשומת הלב של השנאי כדי לאתר גבולות של אובייקטים ללא הנחיה.

איפה זה נופל

המודל מגיע גולמי לחלוטין בלי ראש סיווג מכוונן. אם תעבירו לו תמונה לא תקבלו תשובה מה יש בה, אלא מערך מספרים שדורש מכם לאמן שכבה נוספת מעליו או לבנות מנגנון השוואה וקטורי. בנוסף, הוא אומן על רזולוציה קבועה של 224 על 224 פיקסלים, כך שפרטים עדינים בתמונות גדולות פשוט ילכו לאיבוד בעיבוד המקדים.

שאלות
נפוצות

האם המודל יכול להגיד לי מה מופיע בתמונה?

לא ישירות מהקופסה. המודל פולט וקטורים מספריים של מצבי השכבות האחרונות, ואם רוצים סיווג צריך להוסיף שכבה ייעודית או לחפש גרסה שעברה כוונון עדין למשימה הזו.

מה היתרון של חיתוך 16 לעומת מודלים אחרים?

גודל המשבצת קובע את הרזולוציה של ניתוח התמונה. ריבועים של 16 על 16 נותנים איזון בין מהירות חישוב ליכולת להפריד אובייקטים, אבל מאבדים פרטים זעירים מאוד.

האם חובה כרטיס מסך של אנבידיה כדי להשתמש בו?

ממש לא. בגלל המשקל הנמוך, 657 מגה בייט בלבד, אפשר להריץ עליו היסק מקומי גם על גבי מעבד רגיל של שרת או מחשב נייד בלי להשקיע בחומרה ייעודית.

איך מריצים

במשקל כולל של 657 מגה בייט, מדובר במודל קל להפליא שאין שום סיבה לשלם על API חיצוני כדי לצרוך אותו. אפשר לטעון אותו ישירות דרך ספריית transformers בפייתון עם ViTModel ו־ViTImageProcessor.

הוא רץ חלק על כל כרטיס מסך ביתי מודרני, ואפילו על מעבד רגיל ייתן ביצועים סבירים לחלוטין אם מדובר בבקרת איכות או חישוב וקטורים שלא דורש זמן אמת של אלפיות השנייה.

from transformers import pipeline

pipe = pipeline("image-feature-extraction", model="facebook/dino-vitb16")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 657 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 הוא רישיון קוד פתוח מתירני מאוד. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר סגור ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗