GPT
S

siglip-so400m-patch14-224

קוד פתוח

googleapache-2.02024-08-23

  • transformers
  • safetensors
  • siglip
  • zero-shot-image-classification
  • vision

התאמת תמונות לטקסט בדיוק גבוה ובלי תלות בנרמול מורכב של מנות נתונים. חלופה ישירה וקומפקטית ל־CLIP שמסווגת תמונות לפי תיאור מילולי חופשי.

  • 877Mפרמטרים
  • 16טוקנים בהקשר
  • 3.3 GBמשקל הקבצים
  • 13,491הורדות בחודש

מה זה

מדובר במימוש של ארכיטקטורת SoViT-400m שמחזיק כ־877 מיליון פרמטרים, ואומן על מאגר WebLI. במקום פונקציית ההפסד הרגילה של CLIP, כאן מיושם סיגמואיד שבודק כל צמד תמונה וטקסט בנפרד. זה מאפשר לו לעבוד טוב יותר בגדלים שונים של באצ'ים, בלי צורך לחשב דמיון מול כל שאר הדוגמאות באותו הריצה.

הוא מקבל תמונות ברזולוציה בסיסית של 224 על 224 פיקסלים ומחזיר התאמות למחרוזות טקסט. המבנה האופטימלי שלו מכוון לספק יחס יעיל יותר בין כוח המחשוב לאיכות התוצאה, במיוחד במשימות סיווג אפס־דוגמאות ושליפת תמונות לפי תיאור.

מתאים ל

  • סיווג תמונות ללא אימון

    זיהוי תוויות מרובות בזמן אמת לפי רשימת טקסטים מוגדרת מראש, בלי להכשיר מודל ייעודי.

  • חיפוש תמונות לפי מלל קצר

    מיפוי תמונות ושאילתות חיפוש לאותו מרחב וקטורי כדי לאפשר שליפה לפי ביטויים קצרים.

  • סינון תוכן אוטומטי

    בדיקת התאמה של תמונות שהעלו משתמשים לקטגוריות אסורות או תיאורים לא הולמים.

איפה זה נופל

חלון ההקשר עומד על 16 טוקנים בלבד, מה שאומר שאי אפשר להעביר לו פסקאות או תיאורים מורכבים. הוא מיועד לתוויות קצרות או משפטים בסיסיים, וטקסט ארוך פשוט ייחתך. בנוסף, הרזולוציה היא 224 על 224 פיקסלים בלבד. תמונות שמסתמכות על פרטים קטנים או טקסט זעיר בתוך התמונה יאבדו מהר מאוד מהדיוק שלהן. הכרטיס גם מציין שצוות הפיתוח המקורי של גוגל לא כתב את התיעוד אלא אנשי Hugging Face, כך שאין פירוט על הטיות במאגר WebLI.

שאלות
נפוצות

האם אפשר להעביר לו תיאורי תמונה ארוכים בעברית?

המודל מוגבל לחלון הקשר קצרצר של 16 טוקנים, ולכן הוא לא מתאים לפסקאות אלא למילים בודדות או משפטים קצרים מאוד. הוא אומן על WebLI שכולל שפות רבות, אך כדאי לבדוק בפועל את הדיוק בעברית מול אנגלית.

במה הוא שונה ממודל CLIP סטנדרטי?

במקום להשוות כל תמונה לכל הטקסטים בבאץ' בבת אחת, הוא משתמש בחישוב סיגמואיד עצמאי לכל זוג. זה הופך את פעולת הניקוד ליציבה יותר ולא תלויה בגודל המנה שמריצים.

איך מריצים

המודל שוקל 3.3 ג'יגה־בייט ומיועד לספריית transformers. אפשר להריץ אותו עם פייפליין פשוט של zero-shot-image-classification או בטעינה ישירה של המודל והפרוססור באמצעות PyTorch. כרטיס מסך בסיסי עם 8 או 12 ג'יגה זיכרון יחזיק אותו בקלות בריצה מקומית בדיוק float32.

הוא מתאים להרצה על שרת עצמאי אם צריך עיבוד רציף או פרטיות על התמונות. אם אתם מעבדים רק כמה עשרות תמונות ביום ולא רוצים להחזיק תשתית דולקת, שירות ענן חיצוני יהיה הגיוני יותר.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="google/siglip-so400m-patch14-224")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 3.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי חופשי לחלוטין. אפשר לשנות את הקוד, לשלב אותו במוצרים סגורים ולהפיץ אותם, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗