GPT
S

siglip-so400m-patch14-384

קוד פתוח

googleapache-2.02024-01-08

  • transformers
  • safetensors
  • siglip
  • zero-shot-image-classification
  • vision

אלטרנטיבה מודרנית וחזקה ל־CLIP שמחברת בין תמונה לטקסט בדיוק גבוה. מקבלים כאן ראיית מחשב חדה יותר בזכות רזולוציה של 384x384 ופונקציית הפסד יעילה.

  • 878Mפרמטרים
  • 3.3 GBמשקל הקבצים
  • 1,373,964הורדות בחודש
  • 688לייקים

מה זה

גוגל לקחו את הרעיון של מודלי שפה ותמונה כמו CLIP והחליפו את פונקציית ה־softmax הרגילה ב־sigmoid. השינוי המתמטי הזה אומר שהאימון לא דרש השוואה מול כל התמונות באצווה בו זמנית, מה שנתן מודל יציב ומדויק יותר גם בגדלי אצווה קטנים.

הגרסה הזו רצה על ארכיטקטורת SoViT-400m שעברה אופטימיזציית מבנה לפי חוקי סקיילינג, וכוללת כ־878 מיליון פרמטרים. היא אומנה על מאגר WebLI ברזולוציה של 384x384 פיקסלים עם פאצ'ים של 14, מה שמשפר את היכולת לתפוס פרטים קטנים בתמונה בהשוואה למודלים הוותיקים שהוגבלו לרזולוציות נמוכות יותר.

מתאים ל

  • סיווג תמונות ללא אימון

    מזינים תמונה וכמה תוויות טקסט חופשיות, ומקבלים הסתברות מדויקת לכל אפשרות.

  • חיפוש תמונות לפי טקסט

    יצירת וקטורים משותפים לתמונות וטקסט שמאפשרים לשלוף תמונות מתאימות מתוך מאגר.

  • סינון תוכן ויזואלי

    בדיקת תמונות מול רשימת הגדרות אסורות ישירות מהקוד, בלי לאמן מסווג ייעודי.

איפה זה נופל

צוות הפיתוח המקורי של גוגל לא כתב כרטיס מודל מלא, ולכן חסר פירוט רשמי על הטיות או כשלים ספציפיים. הטקסט מוגבל בריפוד ל־64 טוקנים בלבד, כך שאי אפשר להעביר תיאורים ארוכים או מורכבים. בנוסף, כל תמונה נחתכת ועוברת התאמה כפויה ל־384x384, מה שעלול לעוות יחסי גובה רוחב חריגים לפני שמגיעים בכלל לסיווג.

שאלות
נפוצות

האם המודל מייצר טקסט או עונה על שאלות?

לא. זה אינו מודל שיחה, אלא מודל שמחבר תמונה לטקסט לצורך השוואה, סיווג ושליפה בלבד.

באיזו רזולוציה צריך לשלוח את התמונות?

המעבד של המודל משנה את גודל התמונה אוטומטית ל־384 על 384 פיקסלים, כך שאפשר להעביר כל תמונה והיא תותאם לתקן.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.3 ג'יגה בייט בפורמט float32. אפשר להריץ אותו מקומית בקלות דרך ספריית transformers הרגילה, באמצעות קריאת pipeline בסיסית או טעינת AutoModel ישירה.

כל כרטיס מסך מודרני עם לפחות 6 עד 8 ג'יגה זיכרון יריץ אותו בלי למצמץ. אם אין לכם חומרה ייעודית מקומית ואתם צריכים רק תיוג של תמונות בודדות מדי פעם, כנראה יהיה פשוט יותר לשלוח את הבקשות לשרת מרוחק במקום להחזיק תהליך ייעודי ברקע.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="google/siglip-so400m-patch14-384")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים פנימיים או למכור שירותים שמבוססים עליו. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗