GPT
V

vit-large-patch16-224

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • vit

סיווג תמונות קלאסי מבוסס טרנספורמר עם 24 שכבות של גוגל. מתאים למי שצריך חילוץ מאפיינים עמוק או זיהוי של אלף הקטגוריות של אימג'נט.

  • 3.4 GBמשקל הקבצים
  • 22,891הורדות בחודש
  • 49לייקים
  • 24שכבות

מה זה

הארכיטקטורה כאן חותכת תמונות לריבועים של 16 על 16 פיקסלים ומתייחסת אליהם כמו אל מילים בטקסט, בדומה לאופן שבו מודלים כמו BERT עובדים. המודל אומן קודם על מאגר ImageNet-21k שמכיל 14 מיליון תמונות ורבבות קטגוריות, ואז עבר כוונון עדין על סט הנתונים של ImageNet 2012 שמכיל מיליון תמונות ומחזיר אחת מתוך 1,000 תוויות מוגדרות.

המשקל שלו מגיע ל־3.4 גיגה-בייט שמחולקים בשבעה קבצים, מה שמציב אותו בקטגוריית ה־large הכבדה יחסית למשימות ראייה ממוחשבת בסיסיות. מעבר לסיווג ישיר, אפשר להשתמש בשכבה האחרונה של טוקן ה־CLS כדי לחלץ וקטור שמייצג את התמונה כולה, ואז להלביש עליו שכבה לינארית למשימות סיווג מותאמות אישית.

מתאים ל

  • סיווג תמונות כללי

    זיהוי אובייקטים שנכללים בתוך אלף המחלקות המוגדרות של ImageNet.

  • חילוץ מאפיינים לאימון

    שליפת ייצוג וקטורי של התמונה דרך טוקן ה־CLS כדי לאמן מסווג חדש.

  • כוונון עדין למאגר ייעודי

    בניית מודל מותאם אישית שמתבסס על 24 שכבות שאומנו על מיליוני תמונות.

איפה זה נופל

הרזולוציה מקובעת ל־224 על 224 פיקסלים בלבד. כל תמונה נחתכת, עוברת שינוי גודל ונרמול לערכים האלה, כך שפרטים קטנים פשוט הולכים לאיבוד, והיוצרים עצמם מציינים שבכוונון עדין התוצאות הטובות יותר מגיעות ברזולוציה של 384 על 384. בנוסף, המודל הגולמי מוגבל בדיוק ל־1,000 הקטגוריות של ImageNet, כך שהוא לא יודע לזהות ישויות מחוץ לרשימה הזו בלי אימון של שכבה נוספת.

שאלות
נפוצות

האם המודל יודע להתמודד עם תמונות ברזולוציה גבוהה?

לא באופן ישיר. תמונות קלט עוברות כיווץ ל־224 על 224 פיקסלים כחלק משלב העיבוד המקדים, ופרטים עדינים בתמונה נמחקים בתהליך הזה.

האם אפשר להריץ אותו בסביבת עבודה של TensorFlow?

לפי כרטיס המודל, התמיכה בטנזורפלו וב־JAX סומנה ככזו שתגיע בהמשך. כרגע המשקולות המומרות נתמכות רשמית בעיקר בפייתורץ'.

איך מריצים

כדי להריץ אותו צריך התקנה של ספריית transformers וסביבת PyTorch, כשבשלב זה התמיכה בטנזורפלו לא זמינה לפי הכרטיס. קובצי המודל שוקלים 3.4 גיגה-בייט, כך שצריך כרטיס מסך עם לפחות 6 עד 8 גיגה-בייט זיכרון כדי לבצע היקש בצורה חלקה בלי צווארי בקבוק, או להריץ אותו על מעבד רגיל בקצב אטי משמעותית.

אם אתם צריכים לסווג תמונה בודדת פעם בכמה דקות או לבצע בדיקות ראשוניות, שירות ענן חיצוני יחסוך את התחזוקה והחזקת הזיכרון. הרצה עצמית מקומית תשתלם בעיקר אם אתם מעבדים נפח גדול של תמונות באופן קבוע או מאמנים שכבה משלכם על בסיס המשקולות.

from transformers import pipeline

pipe = pipeline("image-classification", model="google/vit-large-patch16-224")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 3.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו במוצר סגור, בלי לשלם תמלוגים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗