GPT
S

siglip2-so400m-patch16-512

קוד פתוח

googleapache-2.02025-02-17

  • transformers
  • safetensors
  • siglip
  • vision
  • zero-shot-image-classification

מודל ראייה ושפה שנועד לסיווג תמונות מאפס ולחיפוש לפי טקסט. מקבלים כאן רזולוציה של 512 פיקסלים והבנה מרחבית משופרת בלי לחרוג מגודל של כמיליארד פרמטרים.

  • 1.1Bפרמטרים
  • 4.3 GBמשקל הקבצים
  • 69,192הורדות בחודש
  • 46לייקים

מה זה

מדובר בגרסה מתקדמת של ארכיטקטורת SigLIP מבית גוגל, שמחברת בין טקסט לתמונה בצורה יעילה יותר מ־CLIP רגיל. הדגם הספציפי הזה משתמש בגודל תמונה של 512 על 512 פיקסלים ובחלוקה לפאצ'ים של 16, מה שנותן לו יכולת לקלוט פרטים קטנים יותר ביחס לגרסאות הבסיס שעובדות על רזולוציה נמוכה.

האימון נעשה על מאגר WebLI העצום בעזרת שיטות אימון חדשות, כמו שילוב של חיזוי מקומי ומסכות, כדי לשפר הבנה סמנטית ומיקום של אובייקטים בתוך הפריים. המשמעות בשטח היא יכולת טובה יותר לזהות מה נמצא איפה, ולא רק להבין באופן כללי מה נושא התמונה, לצד גמישות ביחסי תמונה שונים.

עם 1.1 מיליארד פרמטרים, המודל הזה מתפקד כרכיב עצמאי לסיווג בלי אימון מקדים, או כמנוע ראייה שאפשר להרכיב בתוך מודלי שפה גדולים שצריכים לראות.

מתאים ל

  • סיווג תמונות ללא אימון

    זיהוי תוכן תמונות לפי רשימת תוויות טקסט חופשית, בלי צורך לאמן מודל ייעודי מראש.

  • מנוע חיפוש תמונות בטקסט

    שליפת תמונות ממאגר לפי תיאור מילולי מדויק בזכות ייצוג וקטורי משותף לשפה ולתמונה.

  • רכיב ראייה למודלי שפה

    שימוש כחלק הקולט תמונות בתוך מודלים רב־מודאליים גדולים שצריכים לנתח ויזואלית.

איפה זה נופל

למרות השדרוג ברזולוציה ל־512 פיקסלים, המודל עדיין מוגבל כשמדובר בטקסט זעיר בתוך תמונה או במסמכים צפופים. האימון על נתוני רשת מביא איתו הטיות מוכרות, והוא עלול להתקשות באבחנה בין פרטים דומים מאוד שדורשים מומחיות ספציפית, כמו זיהוי רכיבים אלקטרוניים או תמונות רפואיות. כדאי לבדוק אותו מראש מול הדאטה שלכם ולא להניח שהוא יבין כל הקשר לוקלי או מונחים בעברית בלי התאמה.

שאלות
נפוצות

כמה זיכרון וידאו צריך כדי להריץ אותו בפועל?

המשקלים תופסים כ־4.3 גיגה בייט על הדיסק. בזמן ריצה רגילה עם PyTorch, כרטיס עם 8 גיגה בייט זיכרון יספיק לעיבוד תמונות בודדות, אך למנות גדולות מומלץ כרטיס של 12 או 16 גיגה בייט.

האם המודל מבין טקסט בעברית לצורך חיפוש וסיווג?

מאגר האימון של גוגל מכיל נתונים רב־לשוניים מהרשת, אך איכות ההבנה בעברית נמוכה בהשוואה לאנגלית. מומלץ לעבוד באנגלית כדי לקבל דיוק מרבי בסיווג ובחיפוש.

איך מריצים

טעינת המודל מתבצעת ישירות דרך ספריית transformers בפייתון, בפקודת pipeline פשוטה או באמצעות טעינת המשקלים ישירות ל־PyTorch. הקבצים שוקלים 4.3 גיגה בייט, כך שכרטיס מסך בסיסי עם 8 עד 12 גיגה בייט זיכרון יריץ אותו בקלות לצורך הסקת מסקנות, בלי צורך בחומרה כבדה או בשרתים מרובי כרטיסים.

אם אתם צריכים לאנדקס מיליוני תמונות ביום או להריץ חיפוש בזמן אמת, הרצה עצמית על חומרה שלכם תהיה זולה ומהירה בהרבה משימוש ב־API חיצוני. לעומת זאת, אם כל מה שאתם צריכים זה לסווג כמה מאות תמונות בודדות פעם בחודש, הקמת שרת ייעודי פשוט תהיה בזבוז זמן.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="google/siglip2-so400m-patch16-512")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0 הפתוח. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים לגוגל. הדרישה העיקרית היא לשמור על הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗