GPT
V

ViT-B-16-SigLIP

קוד פתוח

timmapache-2.02023-10-16

  • open_clip
  • safetensors
  • clip
  • siglip
  • zero-shot-image-classification

הסבה של מודל SigLIP של גוגל מ־JAX ל־PyTorch, לסיווג תמונות באפס דוגמאות. הוא מביא אימון על WebLI ומאפשר עבודה נוחה עם OpenCLIP ו־timm.

  • 1.5 GBמשקל הקבצים
  • 163,154הורדות בחודש
  • 40לייקים

מה זה

מדובר במודל מבוסס ארכיטקטורת Vision Transformer בגודל בסיס עם פאצ'ים של 16, שמשתמש בפונקציית הפסד מבוססת סיגמואיד במקום סופטמקס הרגיל של CLIP. המשקלים הומרו ממאגר Big Vision של גוגל ישירות לפורמט PyTorch, כך שאפשר לשלב אותו בצורה חלקה בפרויקטים קיימים בלי לגעת ב־JAX.

המודל אומן על מאגר WebLI, והוא מטפל בשתי משימות עיקריות. אם טוענים אותו דרך OpenCLIP מקבלים תמיכה מלאה בתמונה וטקסט עבור סיווג ללא דוגמאות קודמות, ואם טוענים אותו דרך timm מקבלים רשת תמונה בלבד שמפיקה וקטור מאפיינים נוח לחיפוש או לתיוג. מבחינת גודל הוא יושב על נקודת אמצע סבירה בין דיוק למשאבים, בלי להכביד על התשתית שלכם.

מתאים ל

  • חילוץ וקטורים מתמונות

    שליפת ייצוג מספרי מתמונות באמצעות timm לצורך חיפוש דמיון ויזואלי.

  • סיווג תמונות מאפס

    התאמת תמונות לקטגוריות טקסטואליות בלי אימון מחדש דרך OpenCLIP.

  • תיוג תוכן אוטומטי

    זיהוי נושאים בתמונה מתוך רשימת תגיות מוגדרת מראש בעזרת טקסט חופשי.

איפה זה נופל

אם אתם טוענים את המודל ישירות דרך timm, אתם מקבלים רק את רכיב התמונה ומאבדים את היכולת לעבוד מול טקסט. כדי לבצע סיווג ללא דוגמאות חייבים לעבור דרך OpenCLIP. מעבר לזה, המודל מתבסס על המרות ממשקלי JAX המקוריים של WebLI, ולכן חייבים לבדוק שהטרנספורמציות והעיבוד המקדים של התמונה מדויקים לחלוטין כדי לא לאבד מביצועי המקור.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות עם טקסט?

דרך ספריית timm מקבלים רק את רכיב הראייה לחילוץ מאפיינים מתמונות. אם אתם צריכים סיווג מול תיאורי טקסט, יש לטעון את המשקלים דרך OpenCLIP.

איזה חומרה מינימלית נדרשת להרצה?

המודל שוקל 1.5 גיגה בייט בלבד, ולכן הוא רץ מצוין על כל כרטיס מסך פשוט עם כמה גיגה בייט של זיכרון. אפשר להריץ אותו גם על מעבד רגיל עבור עיבוד של תמונות בודדות.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.5 גיגה בייט, כך שאפשר להריץ אותו בקלות על כמעט כל כרטיס מסך מודרני, ואפילו על מעבד רגיל אם הקצב פחות קריטי לכם. השימוש מתבצע בקוד פייתון ישיר מול timm או open_clip, כפי שמוצג בדוגמה עם vit_base_patch16_siglip_224 שמחלצת מאפיינים מתמונה בגודל מתאים.

אם אתם צריכים רק וקטורים מתמונות, timm מספיק לגמרי עם פקודת יצירה פשוטה והגדרת טרנספורמציות בסיסיות. אין סיבה אמיתית לשלם על API חיצוני כשמדובר במודל ששוקל ג'יגה וחצי בלבד, אלא אם אתם עובדים בסקייל ענק ואין לכם שרת עם מאיץ גרפי זמין.

pip install -U huggingface_hub
hf download timm/ViT-B-16-SigLIP

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המשקלים בתוך מוצר סגור. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים ומסמך הרישיון המקורי, בלי להטיל אחריות על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗