GPT
V

ViT-SO400M-14-SigLIP-384

קוד פתוח

timmapache-2.02023-10-16

  • open_clip
  • safetensors
  • clip
  • siglip
  • zero-shot-image-classification

המודל הזה מחבר תמונות וטקסט ברזולוציה גבוהה יחסית של 384 פיקסלים. הוא מיועד למי שמחפש סיווג תמונות בלי אימון מוקדם על בסיס ארכיטקטורת SigLIP.

  • 6.5 GBמשקל הקבצים
  • 128,497הורדות בחודש
  • 82לייקים

מה זה

מדובר בהמרה לפייטרוץ' של משקולות שנולדו במקור בפרויקט Big Vision של גוגל ונכתבו ב־JAX. הרעיון המרכזי מאחורי SigLIP הוא החלפת פונקציית ה־Softmax המוכרת מ־CLIP בפונקציית סיגמואיד פשוטה יותר, שלומדת זוגות של תמונה וטקסט בצורה יעילה יותר על גבי מאגר WebLI.

המשקל של הקבצים מגיע ל־6.5 גיגה-בייט, מה שמציב אותו בקטגוריית גודל בינונית-גבוהה עם ארכיטקטורת SO400M וגודל פאטץ' של 14. השילוב הזה נותן יכולת טובה לזהות פרטים עדינים בתמונות בזכות קלט בריבוע של 384 פיקסלים, שזה משמעותית יותר מפורמט ה־224 הסטנדרטי שתמצאו ברוב המודלים הוותיקים בתחום.

בפועל אתם מקבלים וקטור מאפיינים עשיר לכל תמונה או טקסט שאתם מזינים. זה מתאים בעיקר למשימות שבהן צריך להתאים בין תיאורים חופשיים לתמונות קיימות, בלי לבנות מודל סיווג ייעודי לכל קטגוריה בנפרד.

מתאים ל

  • סיווג תמונות פתוח

    מאפשר לסווג תמונות לפי תוויות טקסט חופשיות בלי צורך לאמן שכבות סיווג חדשות.

  • חילוץ וקטורים לתמונות

    מייצר ייצוג מספרי עשיר ברזולוציה של 384 פיקסלים ישירות דרך ספריית timm.

  • חיפוש תמונה לפי טקסט

    מתאים מנועי חיפוש ויזואליים שמקבלים שאילתת טקסט ומוצאים את התמונה הקרובה ביותר.

איפה זה נופל

הכרטיס לא מספק נתוני ביצועים מפורטים, ציוני דיוק או חלוקה לפי קטגוריות ספציפיות מתוך המאגר. הוא אומן על WebLI, מה שאומר שהוא מכיל הטיות אינטרנטיות גולמיות ולא תמיד יזהה מושגים מקומיים או תמונות מורכבות בעברית בלי בדיקה מקדימה. בנוסף, אם תטענו אותו דרך timm בלבד, תקבלו רק את רכיב התמונה ותאבדו את יכולת עיבוד הטקסט, מה שמחייב שימוש ב־OpenCLIP לכל סיווג אמיתי.

שאלות
נפוצות

האם המודל מבין טקסט בעברית?

הוא אומן על מאגר WebLI שמכיל נתונים מרחבי הרשת, אבל הכרטיס לא מציין תמיכה רשמית בעברית. מומלץ לבדוק את איכות ההתאמה על מדגם קטן של תיאורים בעברית מול אנגלית לפני שמשלבים אותו במערכת.

מה ההבדל בין הרצה ב־timm להרצה ב־OpenCLIP?

דרך timm אפשר לחלץ רק וקטורים של תמונות כדי לחבר אותם למודל אחר או למאגר נתונים. אם אתם רוצים להשוות בין טקסט לתמונה או לבצע סיווג ישיר, חובה להשתמש ב־OpenCLIP שמפעיל גם את מקודד הטקסט.

איך מריצים

כדי להריץ את המודל תצטרכו כרטיס מסך עם לפחות שמונה עד עשרה גיגה זיכרון כדי לטעון את כל המשקולות ולבצע היקש בצורה נוחה. הקבצים שוקלים 6.5 גיגה, כך שעל מעבד רגיל תרגישו איטיות כבדה בכל תמונה שתעבירו דרכו.

אפשר להריץ אותו דרך ספריית timm אם אתם צריכים רק וקטורים של תמונות, או דרך OpenCLIP אם אתם רוצים את החיבור המלא בין טקסט לתמונה. אם יש לכם שרת מקומי עם מאיץ גרפי מתאים עדיף להריץ אותו בעצמכם, אבל אם אתם צריכים רק בדיקות מזדמנות ואין לכם חומרה זמינה, עדיף להשתמש בנקודת קצה מנוהלת בענן.

pip install -U huggingface_hub
hf download timm/ViT-SO400M-14-SigLIP-384

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו הלאה בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗