GPT
S

siglip2-base-patch16-224

קוד פתוח

googleapache-2.02025-02-17

  • transformers
  • safetensors
  • siglip
  • vision
  • zero-shot-image-classification

מודל ראייה ושפה קל משקל שמחבר בין טקסט לתמונות בדיוק גבוה. גוגל בנו אותו כדי לסווג תמונות בלי אימון מראש ולשמש רכיב ראייה במערכות גדולות יותר.

  • 375Mפרמטרים
  • 1.4 GBמשקל הקבצים
  • 1,516,333הורדות בחודש
  • 134לייקים

מה זה

מדובר במודל ראייה מבוסס שנאים שכולל 375 מיליון פרמטרים, ומציע שדרוג ישיר לארכיטקטורת סיגליפ המקורית. הוא אומן על מאגר התמונות והטקסט וובלי באמצעות שילוב מטרות אימון חדשות, כולל חיזוי חלקים מוסתרים והתאמה לגדלים ופרופורציות שונות של תמונות. המטרה כאן היא לייצר הבנה סמנטית עמוקה יותר של פרטים בתוך התמונה, ולא רק תפיסה כללית של הפריים.

המודל מיועד בעיקר לסיווג תמונות באפס דוגמאות ושליפת תמונות לפי תיאור טקסטואלי, לצד הפקת וקטורים שיכולים להזין מודלי שפה רב מודליים. התוצאה היא יכולת מיקום טובה יותר של אובייקטים והבנת קשרים צפופים במרחב הוויזואלי, תוך שמירה על משקל קבצים צנוע של 1.4 גיגה בייט בלבד.

מתאים ל

  • סיווג תמונות ללא אימון

    מאפשר לסווג קטלוג מוצרים או תמונות משתמשים לפי רשימת תוויות טקסט חופשית, בלי צורך להכשיר מסווג ייעודי.

  • מנוע חיפוש תמונות לפי טקסט

    מייצר וקטורים לייצוג תמונה וטקסט באותו מרחב, מה שמאפשר למצוא תמונות מתאימות לשאילתות טקסטואליות.

  • רכיב ראייה למודלי שפה

    משמש מגדל ראייה יעיל שממיר קלט חזותי למידע שמודלי שפה גדולים יכולים לעבד ולהגיב עליו.

איפה זה נופל

הרזולוציה המקורית של הגרסה הזו מוגבלת לריבועים של 224 על 224 פיקסלים בחלוקה לטלאים של 16 פיקסלים. זה אומר שאם יש לכם תמונות עם פרטים זעירים, טקסט קטן או מסמכים שלמים שדורשים קריאה מדויקת, הוא יפספס אותם או יטשטש את המידע החשוב.

בנוסף, הכרטיס מציין אימון על מאגר וובלי בלי לפרט מספרי ביצועים מדויקים עבור סיווג בעברית, ולכן חובה לבדוק התאמה מקומית לטקסטים בעברית לפני שסומכים על תגיות הטקסט שלו בפרודקשן.

שאלות
נפוצות

האם כדאי להשתמש בגרסה הזו לחיפוש תמונות עם טקסט קטן?

לא מומלץ. רזולוציית הקלט מוגבלת ל־224 פיקסלים, כך שטקסט זעיר או פרטים דקים בתוך התמונה ילכו לאיבוד בעיבוד הטלאים.

האם המודל מבין תוויות חיפוש בעברית?

הוא אומן על וובלי שכולל מידע רב לשוני, אך הכרטיס אינו מציג מדדים ספציפיים לעברית. רצוי מאוד לבחון אותו מול שאילתות מקומיות לפני שילוב במערכת פעילה.

איך מריצים

אתם יכולים לטעון אותו ישירות דרך ספריית טרנספורמרס של האגינג פייס בעזרת צינור סיווג או ישירות דרך מודל הבסיס. בזכות משקל של פחות מגיגה וחצי, הוא רץ בלי שום בעיה על כרטיס מסך ביתי בסיסי, ואפילו על מעבד מרכזי בשרת ענן סטנדרטי בלי לשבור את הראש על אופטימיזציות זיכרון מורכבות.

אם אתם צריכים לאנדקס מיליוני תמונות ביום או לחבר אותו למערכת חיפוש פנימית, אין שום סיבה לשלם על קריאות שרת חיצוניות, עדיף להרים אותו עצמאית בקונטיינר מקומי. שירותי צד שלישי שווים את זה רק אם אין לכם שום תשתית להרצת מודלים ואתם צריכים רק בדיקת היתכנות מהירה לכמה מאות תמונות.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="google/siglip2-base-patch16-224")
print(pipe("שלום"))

הרישיון

הרישיון הוא אפאצ'י שתיים אפס, שזה רישיון קוד פתוח מתירני מאוד. אתם יכולים להשתמש בו באופן מסחרי, לשנות אותו, להטמיע אותו במוצר שלכם ולחלק אותו הלאה, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצהירים על שינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗