GPT
V

vit_large_patch14_clip_224.openai_ft_in12k_in1k

קוד פתוח

timmapache-2.02022-11-03

  • timm
  • pytorch
  • safetensors
  • image-classification
  • transformers

טרנספורמר ראייה גדול שמבוסס על משקלי CLIP של OpenAI ועבר כוונון עדין כפול לסיווג תמונות. הוא מתאים למי שחייב ייצוג ויזואלי עמוק ומדויק מתוך מאגר תגיות מוכר.

  • 304Mפרמטרים
  • 2.3 GBמשקל הקבצים
  • 1,608הורדות בחודש
  • 38לייקים

מה זה

מדובר בארכיטקטורת ViT-Large עם גודל מקטע של 14 על 14 פיקסלים, שהתחילה את דרכה באימון מקדים של OpenAI על מאגר WIT-400M. לאחר מכן המודל עבר כוונון נוסף על ImageNet-12k, ולבסוף כוונן ספציפית על ImageNet-1k בתוך ספריית timm. השרשרת הזו מעניקה לו הבנה ויזואלית רחבה בהרבה ממודל שאומן ישירות על אלף מחלקות בלבד.

עם 304 מיליון פרמטרים וחישוב כבד של 77.8 GMACs לכל תמונה בודדת, המודל הזה מתפקד כמסווג ישיר של אלף מחלקות או כחולץ תכונות עמוק. ההבדל בינו לבין מודלים רגילים באותו סדר גודל הוא בסיס הנתונים הרב לשוני והעשיר של CLIP, שמעניק עמידות טובה יותר לשינויים בסגנון התמונה ומשפר את יכולת ההכללה הכללית.

מתאים ל

  • סיווג תמונות מדויק

    זיהוי אלף הקטגוריות של ImageNet בדיוק גבוה בזכות אימון מקדים רחב היקף של CLIP.

  • חילוץ וקטורי תכונות

    שימוש ברשת כבסיס עמוק להפקת ייצוגים ויזואליים עבור מנועי חיפוש דמיון והשוואת תמונות.

  • העברת למידה למשימות ייעודיות

    החלפת ראש הסיווג ואימון עדין על דאטה פנימי של החברה עם בסיס ידע ויזואלי מוצק.

איפה זה נופל

הרזולוציה נעולה על 224 על 224 פיקסלים בלבד. אם יש לכם פרטים זעירים או מסמכים, המודל פשוט מכווץ ומאבד אותם. מעבר לזה, ראש הסיווג מוגבל לאלף הקטגוריות של ImageNet-1k בלבד, לכן הוא לא מתאים לזיהוי חופשי של אובייקטים ללא אימון מחדש של השכבה האחרונה. בנוסף, חלוקת התמונה לטלאים של 14 על 14 דורשת משאבי חישוב כבדים יחסית לרזולוציה הזו, והוא יהיה אטי משמעותית ממודלי קונבולוציה קלאסיים באותו משקל.

שאלות
נפוצות

האם המודל תומך בטקסט חופשי כמו CLIP המקורי?

לא. המודל עבר כוונון עדין לסיווג תמונות קלאסי ב־timm ומחזיר ציונים עבור אלף מחלקות קבועות, בלי רכיב הטקסט של המקור.

אפשר להזין לו תמונות ברזולוציה גבוהה מ־224 פיקסלים?

לא מומלץ בלי התאמות. המודל הוגדר ואומן על גודל 224 על 224, והזנת גודל אחר דורשת אינטרפולציה של שכבות המיקום ופוגעת בדיוק.

איך מריצים

טוענים אותו ישירות דרך ספריית timm בפייתון בשלוש שורות קוד. כל מה שצריך זה לייבא את המודל, לקבל את פונקציות הטרנספורמציה המתאימות לגודל 224 על 224, ולהעביר אליו תמונה שעברה עיבוד בסיסי עם Pillow.

הקבצים שוקלים 2.3 גיגה בייט, כך שכל כרטיס מסך מודרני עם 6 עד 8 גיגה זיכרון מריץ אותו בקלות בודדת או באצוות קטנות. בגלל דרישת חישוב של כמעט 78 GMACs, אם אתם צריכים לסווג מיליוני תמונות ביום בזמן אמת ואין לכם שרת ייעודי, עדיף להשתמש בשרות ענן מנוהל או במודל קטן יותר.

pip install -U huggingface_hub
hf download timm/vit_large_patch14_clip_224.openai_ft_in12k_in1k

הקבצים

6 קבצים במאגר, 2.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים זמינים תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של המשקלים והפצה בחינם או בתשלום, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗