GPT
V

vit-base-patch16-224-in21k

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

הבסיס הקלאסי לחילוץ מאפיינים מתמונות של גוגל, מאומן על 14 מיליון תמונות. הוא מתאים למי שבונה קלסיפייר משלו וצריך מודל מוכח להתחיל ממנו.

  • 86Mפרמטרים
  • 1.3 GBמשקל הקבצים
  • 1,384,812הורדות בחודש
  • 417לייקים

מה זה

מדובר בארכיטקטורת טרנספורמר לתמונות של גוגל, שמפרקת כל תמונה לחלקים בגודל 16 על 16 פיקסלים ומעבדת אותם כמו מילים במשפט. המודל אומן על ImageNet-21k, מאגר שמכיל 14 מיליון תמונות המחולקות ליותר מ־21 אלף קטגוריות שונות, כך שיש לו הבנה רחבה מאוד של עצמים ויזואליים.

המשקל שלו עומד על 86 מיליון פרמטרים ב־12 שכבות, מה שמציב אותו בנקודת פתיחה קלה ונוחה מאוד לעבודה. החוקרים של גוגל איפסו את ראש הסיווג הסופי שלו, ולכן הוא לא מנחש קטגוריות מהקופסה. במקום זה מקבלים וקטור ייצוג עשיר מתוך טוקן ה־CLS או ה־pooler, שמשמש כבסיס לחילוץ מאפיינים ולחיבור ראש סיווג חדש שמתאים למשימה שלכם.

המודל דורש תמונות ברזולוציה קבועה של 224 על 224 פיקסלים בלבד. בכרטיס המודל מציינים שבמאמר המקורי התוצאות הטובות ביותר בכוונון עדין הושגו דווקא ברזולוציה של 384 על 384, כך שהגרסה הזו מכוונת בעיקר לאימון מקדים מהיר וחסכוני במשאבים ולא לדיוק קצה ברזולוציות גבוהות.

מתאים ל

  • בסיס לאימון מסווג ייעודי

    מאומן על 14 מיליון תמונות וכולל שכבת ייצוג מוכנה להוספת קלסיפייר משלכם.

  • חילוץ וקטורים לחיפוש תמונות

    ממיר תמונות לווקטורים עשירים באמצעות ה־CLS token לצורך השוואת דמיון.

  • סיווג תמונות קל משקל בשרת

    שוקל רק 1.3 גיגה ורץ ביעילות על חומרה צנועה בלי לגרור עלויות שרתים גבוהות.

איפה זה נופל

החיסרון הברור ביותר הוא שהמודל לא פולט תוויות סיווג ישירות, כי הראש שלו אופס לחלוטין. אם תעבירו לו תמונה לא תקבלו תשובה מה יש בה, אלא מערך מספרים שדורש מכם לאמן שכבה נוספת מעליו. בנוסף, הוא מוגבל לרזולוציה נמוכה של 224 על 224 פיקסלים, שמקשה על זיהוי פרטים קטנים או מסמכים, והכרטיס מדגיש שביצועים גבוהים יותר מתקבלים ברזולוציות של 384 על 384.

שאלות
נפוצות

אפשר להשתמש בו ישירות לזיהוי תמונות?

לא. החוקרים של גוגל איפסו את ראש הסיווג, ולכן המודל מחזיר רק וקטורים ולא קטגוריות. כדי לזהות אובייקטים צריך להוסיף שכבה לינארית מעליו ולאמן אותה על המידע שלכם, או לחפש מודל שעבר כוונון עדין מראש.

האם כדאי להשתמש בו לתמונות גדולות ומפורטות?

לא מומלץ. תהליך העיבוד מכווץ כל תמונה ל־224 על 224 פיקסלים, מה שגורם לאיבוד פרטים עדינים. המאמר המקורי מציין במפורש שתוצאות עדיפות מתקבלות ברזולוציה של 384 על 384 או במודלים גדולים יותר.

איך מריצים

המודל שוקל 1.3 גיגה־בייט ומכיל 86 מיליון פרמטרים, גודל שנכנס בקלות לכל כרטיס מסך בסיסי עם 4 עד 8 גיגה־בייט זיכרון. הוא רץ היטב גם על מעבד רגיל של שרת או מחשב פיתוח, בלי צורך בתשתיות כבדות.

אפשר להריץ אותו בפשטות דרך ספריית transformers ב־PyTorch או ב־JAX ו־Flax, בדיוק לפי הקוד שמצורף לעמוד. אין שום סיבה לשלם ל־API חיצוני על מודל בגודל כזה, כי העלות החישובית שלו זניחה לחלוטין.

from transformers import pipeline

pipe = pipeline("image-feature-extraction", model="google/vit-base-patch16-224-in21k")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה בתוך מוצרים. אתם יכולים לשלב אותו במערכת מסחרית בלי תמלוגים, בתנאי שתשמרו על הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗