GPT
V

vit-base-patch16-224

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

המודל מפרק תמונות לריבועים ומעבד אותן כמו מילים בטקסט. הוא מתאים למי שצריך סיווג תמונות מהיר ואמין לפי קטגוריות סטנדרטיות בלי להסתבך עם ארכיטקטורות כבדות.

  • 87Mפרמטרים
  • 1.3 GBמשקל הקבצים
  • 5,510,787הורדות בחודש
  • 996לייקים

מה זה

הארכיטקטורה כאן מחליפה את שכבות הקונבולוציה המוכרות במנגנון של טרנספורמר מלא, בדיוק כמו במודלים של עיבוד שפה. במקום לעבור על פיקסלים שכנים, הוא מחלק כל תמונה לחתיכות בגודל 16 על 16 פיקסלים, מוסיף מיקום לכל חתיכה, ומריץ אותן דרך 12 שכבות של קידוד.

גוגל אימנו אותו קודם על מאגר ImageNet-21k שמכיל 14 מיליון תמונות, ואז ביצעו התאמה ספציפית על מיליון התמונות של ImageNet המקורי. התוצאה היא משקל נוצה של 87 מיליון פרמטרים שמחזיר תחזית לאחת מתוך 1,000 קטגוריות מוכרות, או משמש כבסיס לחילוץ מאפיינים לאימון שכבה חדשה משלכם.

מתאים ל

  • סיווג תמונות גנרי

    זיהוי אובייקטים מתוך 1,000 המחלקות המוכרות של ImageNet ישירות מהקופסה.

  • חילוץ מאפיינים לאימון

    שימוש בשכבת הקידוד כבסיס לאימון מודל סיווג ייעודי על דאטה פנימי שלכם.

  • מיון ראשוני במכשיר קצה

    סינון וקטלוג מקומי ומהיר בזכות דרישות זיכרון נמוכות וגודל קובץ צנוע.

איפה זה נופל

המגבלה הכי כואבת היא הרזולוציה. התמונות חייבות לעבור כיווץ ל־224 על 224 פיקסלים, מה שמוחק פרטים עדינים בתמונות גדולות או מורכבות. יוצרי המודל אף מציינים במפורש שתוצאות טובות יותר מתקבלות ברזולוציה של 384 על 384 או עם מודלים גדולים יותר. בנוסף, הוא יודע לזהות רק את 1,000 המחלקות של ImageNet, כך שאם אתם צריכים לזהות פגמים בייצור או פריטים ייחודיים, תצטרכו לאמן עליו שכבה עליונה חדשה ולא להשתמש בו כמו שהוא.

שאלות
נפוצות

האם אפשר להעביר לו תמונה בכל גודל?

המעבד המקדים יחתוך ויקטין כל תמונה לגודל של 224 על 224 פיקסלים. אם התמונה המקורית רחבה מאוד או מכילה פרטים קטנים וקריטיים, הכיווץ הזה עלול לפגוע בדיוק של הזיהוי.

האם המודל מזהה מיקום של עצמים בתוך התמונה?

לא, הוא מיועד למשימת סיווג בלבד ומחזיר תווית לכל התמונה כיחידה אחת. כדי לסמן תיבות סביב אובייקטים תצטרכו ארכיטקטורה ייעודית לאיתור.

איך מריצים

טוענים את המשקלים דרך ספריית transformers הרגילה של פייתון, יחד עם ViTImageProcessor שמטפל בחיתוך ובנרמול. הקבצים שוקלים 1.3 גיגהבייט בסך הכול, כך שאפשר להריץ אותו בלי בעיה על מעבד רגיל במחשב פיתוח, או לדחוף אותו למאיץ גרפי פשוט וזול בענן ולקבל מענה מיידי.

בגודל הזה אין שום סיבה לשלם לספק חיצוני על קריאות שרת. אתם מקבלים שליטה מלאה על השרת, אפס תלות ברשת חיצונית, ואפשרות לארוז אותו ישירות בתוך קונטיינר מקומי.

from transformers import pipeline

pipe = pipeline("image-classification", model="google/vit-base-patch16-224")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד, לאמן אותו מחדש ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים המקורית והרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗