GPT
V

vit-base-patch16-384

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

מודל ראייה מבוסס טרנספורמר שמסווג תמונות ברזולוציה של 384x384 פיקסלים. הוא מתאים למי שצריך דיוק גבוה יותר מגרסאות הבסיס הרגילות ומעדיף ארכיטקטורת ViT על פני רשתות קונבולוציה מסורתיות.

  • 87Mפרמטרים
  • 1.3 GBמשקל הקבצים
  • 14,278הורדות בחודש
  • 50לייקים

מה זה

גוגל אימנו את המודל הזה על בסיס נתונים רחב של ImageNet-21k שמכיל 14 מיליון תמונות, ולאחר מכן ביצעו התאמה ספציפית על ImageNet 2012 שמכיל אלף מחלקות. במקום קונבולוציות, הוא מפרק כל תמונה לרשת של טלאים בגודל 16 על 16 פיקסלים ומתייחס אליהם כמו לרצף מילים בטרנספורמר טקסטואלי רגיל.

ההבדל המשמעותי מול מודלי בסיס דומים הוא רזולוציית הקלט. בעוד שהאימון הראשוני רץ על 224x224, שלב הכוונון הסופי נעשה על 384x384 פיקסלים, מה שמאלץ אותו להתמודד עם רצף ארוך יותר של טלאים ומשפר את היכולת לקלוט פרטים עדינים בתמונה.

מתאים ל

  • סיווג תמונות כללי

    זיהוי וקטלוג עצמים מתוך אלף המחלקות המוגדרות של ImageNet ברמת פירוט גבוהה.

  • חילוץ וקטורים ייצוגיים

    שימוש בשכבת הקידוד הפנימית כדי להפיק מאפיינים עשירים מתמונות לפני אימון מסווג חדש.

  • בסיס לכוונון עצמי

    החלפת שכבת הפלט הסופית ואימון עדין של המודל על סט נתונים פרטי ברזולוציה של 384x384.

איפה זה נופל

המודל הזה מכוונן מראש לסווג תמונות לאלף הקטגוריות המוגדרות של ImageNet בלבד. אם תזרקו עליו אובייקטים שלא קיימים בסט הזה, הוא ינסה בכוח להדביק להם תווית לא נכונה. בנוסף, חלוקת התמונה לטלאים קשיחים בגודל 16 על 16 פיקסלים עשויה לפספס עצמים קטנים מאוד שנבלעים בתוך טלאי בודד.

שאלות
נפוצות

האם המודל תומך בתמונות בכל גודל?

הוא מצפה לתמונות מעובדות בגודל אחיד של 384 על 384 פיקסלים. כלי העיבוד המקדים בספריית transformers משנה את גודל התמונה ומנרמל את ערוצי הצבע לפני ההזנה למודל.

מה היתרון של גרסת 384 לעומת גרסת 224 הרגילה?

הרזולוציה המוגדלת מספקת יותר טלאים לטרנספורמר ומאפשרת זיהוי טוב יותר של פרטים קטנים בתמונה. החיסרון הוא צריכת זיכרון גבוהה יותר וזמן עיבוד ארוך יותר לכל תמונה.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות ViTForImageClassification ו־ViTFeatureExtractor. המשקל הכולל של הקבצים עומד על 1.3 ג'יגה בייט עם כ־87 מיליון פרמטרים, כך שאפשר להריץ אותו בלי בעיה על מעבד גרפי ביתי פשוט ואפילו על מעבד מרכזי רגיל אם זמן התגובה פחות קריטי.

הרזולוציה הגבוהה יותר גובה מחיר בחישוב ביחס לגרסאות 224 פיקסלים, כי תשומת הלב בטרנספורמר גדלה ריבועית עם מספר הטלאים. אם נפח התעבורה שלכם נמוך מאוד ואין לכם שרת ייעודי שפועל ברקע, עדיף להשתמש ב־API חיצוני כדי לא לשלם על שרת פנוי.

from transformers import pipeline

pipe = pipeline("image-classification", model="google/vit-base-patch16-384")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצר, ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים המקורית והצהרת הרישיון בכל עותק או נגזרת של המודל שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗