GPT
S

siglip2-so400m-patch14-384

קוד פתוח

googleapache-2.02025-02-17

  • transformers
  • safetensors
  • siglip
  • vision
  • zero-shot-image-classification

מודל ראייה ושפה מודרני מבית גוגל שמסווג תמונות בלי אימון מוקדם ומפיק וקטורים מדויקים. הוא שוקל כארבעה גיגה־בייט ומיועד למי שרוצה ביצועים חזקים בלי להחזיק תשתית מפלצתית.

  • 1.1Bפרמטרים
  • 4.3 GBמשקל הקבצים
  • 889,355הורדות בחודש
  • 103לייקים

מה זה

מדובר במודל שמחבר בין טקסט לתמונה על בסיס ארכיטקטורת SigLIP המקורית, עם שיפורים בלמידה של פרטים קטנים ומיקומים בתוך הפריים. עם כ־1.1 מיליארד פרמטרים, הוא לוקח תמונה ומחרוזות טקסט, ומחזיר התאמה ישירה ביניהן בלי שאימנתם אותו על הקטגוריות הספציפיות שלכם מראש.

גוגל הוסיפו כאן מנגנוני אימון שכוללים חיזוי אזורים מוסתרים והתאמה ליחסי תמונה משתנים, מה שנותן לו יתרון בהבנה של סצנות מורכבות יותר לעומת הדור הקודם. הוא אומן על מאגר WebLI בהיקף עצום באמצעות שבבי TPU ייעודיים, כך שמרחב הייצוג שלו עשיר במיוחד ומתאים גם לחיפוש תמונות וגם כרכיב ראייה עבור מודלי שפה גדולים.

מתאים ל

  • סיווג תמונות מהיר

    מאפשר לסווג תמונות לפי תוויות טקסט חופשיות בלי צורך לאסוף דאטה סט ולאמן מודל ייעודי מראש.

  • מנוע חיפוש תמונות

    מייצר וקטורים מהתמונות לצורך שמירה בבסיס נתונים וקטורי וחיפוש מדויק באמצעות שאילתות טקסט.

  • רכיב ראייה למודלי שפה

    משמש כבסיס לחילוץ מאפיינים חזותיים עבור מודלים רב־מודאליים שצריכים להבין תמונות ולענות עליהן.

איפה זה נופל

הקלט מוגבל לרזולוציה שנגזרת מחלוקה לטלאים של 14 פיקסלים, כך שפרטים מיקרוסקופיים או טקסט זעיר בתוך התמונה ילכו לאיבוד. בנוסף, הכרטיס לא מציג מספרים מספריים מפורטים על שיעורי שגיאה במשימות ספציפיות, אלא רק מפנה למאמר חיצוני, ולכן חובה לבדוק אותו על הדאטה הספציפי שלכם לפני שמסתמכים על התוצאות.

שאלות
נפוצות

האם אפשר להריץ אותו על מעבד רגיל בלי כרטיס מסך ייעודי?

אפשר לטעון אותו על המעבד, שכן מדובר בקצת יותר ממיליארד פרמטרים והוא שוקל 4.3 גיגה. עם זאת, זמני העיבוד פר תמונה יהיו איטיים יחסית, ולכן למוצר אמיתי עדיף כרטיס גרפי סביר.

איך משתמשים בו בפועל עם הקוד הקיים שלי?

טוענים אותו ישירות דרך transformers באמצעות פונקציית pipeline למשימת zero-shot-image-classification, או מושכים את הווקטורים ישירות דרך get_image_features.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.3 גיגה־בייט, מה שאומר שכרטיס מסך בסיסי עם 8 או 12 גיגה זיכרון יריץ אותו בקלות בסביבת פייתון דרך ספריית transformers. אתם טוענים אותו כ־pipeline או כמודל ישיר לחילוץ מאפיינים, וההסקה מתבצעת מקומית בלי תלות ברשת.

אם אתם צריכים לסווג אלפי תמונות בשנייה בקצב משתנה, כדאי לשקול פריסה על שרת ענן ייעודי או שירות מנוהל כדי לא לנהל את הזיכרון לבד. לפרויקטים מקומיים או עיבוד באצ'ים סביר, החומרה הסטנדרטית במשרד תספיק בהחלט.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="google/siglip2-so400m-patch14-384")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות משוחררים תחת רישיון apache-2.0. מותר להשתמש במודל לצרכים מסחריים ופרטיים, לשנות אותו ולשלב אותו במוצרים שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗