GPT
S

siglip2-so400m-patch16-naflex

קוד פתוח

googleapache-2.02025-02-18

  • transformers
  • safetensors
  • siglip2
  • zero-shot-image-classification
  • vision

מודל ראייה ושפה שנועד לסיווג תמונות ללא אימון מוקדם ולחילוץ וקטורים. הוא מתאים למי שרוצה תמיכה ביחסי תצוגה משתנים בלי לחתוך תמונות מראש.

  • 1.1Bפרמטרים
  • 4.3 GBמשקל הקבצים
  • 330,032הורדות בחודש
  • 84לייקים

מה זה

גוגל שחררו כאן שדרוג ישיר למשפחת סיגליפ, שמבוסס על שילוב שיטות אימון חדשות כמו חיזוי מסכות והתאמה לרזולוציות גמישות. הוא יודע לקבל תמונה וטקסט, לחשב ביניהם התאמה ישירה, או לשמש כרכיב הראייה הראשי במודלים רב-מודאליים גדולים יותר.

התוספת המשמעותית בגרסה הזו היא מנגנון של גמישות ביחס התצוגה וברזולוציה. במקום לכפות על כל קובץ להיחתך לגודל ריבועי קבוע ולאבד פרטים חשובים בשוליים, הארכיטקטורה מעבדת את הממדים המקוריים בצורה חלקה יותר. המודל אומן על מאגר ווב-לי ומספק הבנה סמנטית טובה יותר של מיקומי עצמים בתוך הפריים.

מתאים ל

  • סיווג תמונות ללא אימון

    זיהוי קטגוריות מותאמות אישית מתוך רשימת טקסט, בלי צורך להכשיר מסווג ייעודי מראש.

  • מנוע חיפוש תמונה-טקסט

    חילוץ וקטורים להשוואת שאילתות מילוליות מול מאגר תמונות גדול ביחסי תצוגה שונים.

  • רכיב ראייה למודל שפה

    שימוש כשכבת קלט ויזואלית עבור מודלים רב-מודאליים שצריכים עיבוד צפוף ומדויק של תמונות.

איפה זה נופל

המודל מתמקד בסיווג ואחזור בלבד, הוא לא מייצר טקסט חופשי ולא עונה על שאלות מורכבות כמו מודל שיחה רב-מודאלי. החומר הרשמי מודה באימון על דאטה-סט כללי מהרשת, כך שביצועים על מושגים מקומיים או טקסטים קטנים בעברית דורשים בדיקה ידנית זהירה לפני שילוב במערכת פעילה.

שאלות
נפוצות

האם המודל יודע לכתוב תיאור מילולי לתמונה?

לא, הוא אינו מודל שיחה שמייצר טקסט. התפקיד שלו הוא להחזיר ציוני התאמה בין תמונה לבין תוויות טקסט קיימות, או להפיק וקטורים מספריים.

מה היתרון של גרסת הנאפלקס לעומת מודלי ראייה ישנים?

הגרסה הזו מתמודדת עם רזולוציות ויחסי תצוגה גמישים בלי לחתוך את התמונה לריבוע קבוע. זה מונע עיוותים ושומר על מידע קריטי בקצוות הפריים.

איך מריצים

טוענים אותו ישירות דרך ספריית הטרנספורמרס של האגינג פייס עם פייפליין פשוט של סיווג, או בטעינת המודל והמעבד לחילוץ מאפיינים. עם משקל קבצים של 4.3 גיגה-בייט ומיליארד נקודה אחד פרמטרים, תצטרכו כרטיס מסך מודרני עם לפחות שמונה עד שנים-עשר גיגה-בייט זיכרון כדי להריץ אותו בנוחות בדיוק המקורי.

אם אתם צריכים רק לסווג כמה תמונות בודדות פעם ביום, הרמה של שרת ייעודי כנראה מיותרת ועדיף להשתמש בתשתית ענן קיימת. המודל מתאים בעיקר למי שרוצה להריץ חיפוש תמונות עצמאי בקצב גבוה בתוך הרשת שלו בלי תלות בספק חיצוני.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="google/siglip2-so400m-patch16-naflex")
print(pipe("שלום"))

הרישיון

רישיון אפאצ'י שתיים אפס מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה של המודל בחינם או בתוך מוצר סגור. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית של גוגל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗