GPT
S

siglip-base-patch16-256-multilingual

קוד פתוח

googleapache-2.02024-01-08

  • transformers
  • safetensors
  • siglip
  • zero-shot-image-classification
  • vision

מודל ראייה ושפה קל משקל שממיין תמונות מול טקסט חופשי במספר שפות. הוא מחליף את CLIP המוכר בזכות פונקציית הפסד סיגמואידית שמשפרת ביצועים באותו סדר גודל.

  • 371Mפרמטרים
  • 1.4 GBמשקל הקבצים
  • 20,109הורדות בחודש
  • 54לייקים

מה זה

גוגל אימנו כאן גרסה רב לשונית של ארכיטקטורת SigLIP על בסיס דאטה סט שנקרא WebLi, ללא סינון שפות. הרעיון המרכזי בארכיטקטורה הזו הוא החלפת הפסד הסופטמקס המסורתי של CLIP בפונקציית הפסד מבוססת סיגמואיד. השינוי הזה מתייחס לכל זוג תמונה וטקסט בנפרד, מה שמבטל את הצורך לחשב דמיון מול כל שאר הדוגמאות באצווה לצורך נרמול.

בפועל, המודל יודע להתמודד עם סיווג תמונות באפס דוגמאות (Zero-Shot) ועם אחזור הדדי בין תמונות לטקסט. המבנה שלו מביא לתוצאות חדות יותר גם בגדלי אצווה קטנים וגם כשרצים עם אצוות ענקיות, מה שהופך אותו לבחירה עדיפה על פני מודלי CLIP ישנים יותר באותו סדר גודל של פרמטרים.

מתאים ל

  • סיווג תמונות רב לשוני

    מאפשר לסווג קטלוג מוצרים או מדיה באמצעות תוויות טקסט חופשי בלי צורך באימון מחדש של ראש סיווג.

  • חיפוש תמונות לפי טקסט

    מייצר וקטורים משותפים לתמונות ולשאילתות חיפוש, כדי למצוא תמונה מתאימה לפי תיאור מילולי קצר.

  • סינון תוכן אוטומטי

    בודק הסתברות של תמונה מול רשימת תוויות אסורות ישירות מהקופסה, בלי להחזיק מודל כבד או שירות ענן יקר.

איפה זה נופל

התמונות עוברות כיווץ אגרסיבי לרזולוציה של 256 על 256 פיקסלים, והטקסט מוגבל ומרופד מראש ל־64 טוקנים בלבד. זה אומר שפרטים קטנים מאוד בתמונה הולכים לאיבוד, ותיאורי טקסט מורכבים או פסקאות ארוכות פשוט ייחתכו ולא ייקראו. מעבר לזה, צוות הפיתוח המקורי של גוגל לא פרסם כרטיס מודל רשמי עם פירוט הטיות, כך שאיכות הזיהוי בעברית או בשפות שאינן אנגלית דורשת בדיקה יזומה לפני שילוב במערכת חיה.

שאלות
נפוצות

האם המודל תומך בעברית כמו שצריך?

הוא אומן על WebLi ללא סינון שפה, כך שיש לו חשיפה לעברית, אבל כרטיס המודל לא מציג מדידות ספציפיות עבורה. כדאי להריץ עליו מבחן קצר עם כמה עשרות דוגמאות בעברית כדי לוודא שהוא אכן מזהה את התוויות שלכם ברמת דיוק סבירה.

למה להעדיף אותו על פני CLIP המקורי?

פונקציית ההפסד הסיגמואידית שלו הופכת את החישוב ליעיל יותר ומספקת דיוק עדיף באותו גודל מודל. בנוסף, הוא מציע תמיכה רב לשונית מובנית שלא הייתה בגרסאות הבסיסיות של CLIP.

איך מריצים

עם משקל של 1.4 גיגה בייט וכ־371 מיליון פרמטרים, אפשר להריץ אותו בקלות על מעבד רגיל, אבל כרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון יספיק כדי לקבל זמני תגובה של מילישניות בודדות. מריצים אותו ישירות דרך ספריית transformers בפייתון, בין אם בעזרת AutoModel ו־AutoProcessor ובין אם דרך ממשק ה־pipeline המובנה לסיווג באפס דוגמאות.

המשקל הנמוך הופך פנייה ל־API חיצוני למיותרת כמעט לחלוטין. אחזקה עצמית של מודל כזה על גבי שרת מקומי או מכונה זולה בענן תהיה מהירה, חסכונית ופרטית בהרבה.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="google/siglip-base-patch16-256-multilingual")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין, שינוי של הקוד והמשקלים, והפצה מחדש. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי, בלי חובת שיתוף של הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗