GPT
S

siglip2-base-patch16-naflex

קוד פתוח

googleapache-2.02025-02-18

  • transformers
  • safetensors
  • siglip2
  • zero-shot-image-classification
  • vision

מודל ראייה ושפה קומפקטי לסיווג תמונות ואחזור טקסט ללא אימון מוקדם על התוויות שלכם. הוא נותן גמישות ברזולוציה וביחס התמונה בלי לנפח את דרישות החומרה.

  • 375Mפרמטרים
  • 1.4 GBמשקל הקבצים
  • 816,818הורדות בחודש
  • 38לייקים

מה זה

גוגל שחררו את הגרסה הזו כהרחבה ישירה לשיטת האימון של סיגליפ המקורי. המודל מחבר תמונה וטקסט לאותו מרחב וקטורי, כשהמטרה היא להבין הקשרים סמנטיים, לוקליזציה של עצמים ופרטים צפופים בלי שתצטרכו להגדיר מראש קטגוריות סגורות.

החידוש המרכזי בגרסה הזו, מעבר לשילוב משימות חיזוי נוספות בזמן האימון, הוא מנגנון הטיפול ביחסי תמונה ורזולוציות משתנות. במקום לחתוך או למעוך תמונה לריבוע קשיח, הוא מתמודד טוב יותר עם גדלים שונים ישירות דרך הארכיטקטורה. עם 375 מיליון פרמטרים, הוא יושב בדיוק על המשבצת של אנקודר ראייה יעיל שנועד לשמש בסיס למערכות גדולות יותר או כרכיב חיפוש עצמאי.

מתאים ל

  • סיווג תמונות דינמי

    זיהוי תוכן תמונה לפי רשימת תוויות טקסט חופשית שמשתנה בזמן אמת, בלי צורך באימון מחדש של מודל ייעודי.

  • מנוע חיפוש תמונות בטקסט

    חילוץ וקטורים מתמונות כדי לאפשר למשתמשים למצוא פריטים במאגר באמצעות חיפוש במילים חופשיות.

  • אנקודר ראייה למודלי שפה

    רכיב קליטת תמונה יעיל וקל משקל שמזין מידע חזותי לתוך מודל שפה גדול במסגרת מערכת מולטימודלית.

איפה זה נופל

זה אנקודר שמחזיר וקטורים והסתברויות מול תוויות טקסט, לא מודל שמייצר תשובות ארוכות או מסביר מה הוא ראה. אם תבקשו ממנו לנתח מסמכים מורכבים או לענות על שאלות פתוחות, הוא לא הכלי הנכון. בנוסף, האימון התבסס על מאגר וובלי, כך שתמיד קיים סיכוי להטיות תרבותיות או חוסר דיוק בזיהוי עצמים מקומיים שלא מופיעים המון ברשת העולמית.

שאלות
נפוצות

האם המודל תומך בעברית כתוויות לסיווג?

האימון נעשה על מאגר רב לשוני רחב, אבל הביצועים החזקים ביותר שלו הם באנגלית. אם אתם מכניסים תוויות בעברית, שווה לבדוק אותן מול תרגום לאנגלית ולראות אם יש פער ברמת הדיוק.

מה ההבדל בינו לבין מודלי קליפ ישנים יותר באותו הגודל?

הוא מתמודד טוב יותר עם תמונות ביחסי גובה רוחב שונים בלי לעוות אותן, ומציע הבנה טובה יותר של מיקום עצמים בתמונה בזכות שיטת אימון משופרת.

איך מריצים

במשקל של 1.4 גיגה בייט וקצת יותר מ־375 מיליון פרמטרים, המודל הזה רץ בקלות על כרטיס מסך בסיסי עם מעט זיכרון, ואפשר לדחוף אותו גם למעבד רגיל אם זמן התגובה פחות קריטי לכם. טוענים אותו ישירות דרך ספריית transformers של פייתון, או כצינור סיווג מוכן או כחילוץ וקטורים ישיר.

אם אתם צריכים לאנדקס מאגר תמונות פנימי או לבנות סיווג בזמן אמת, אין שום סיבה לשלם לספק חיצוני על כל קריאה. הממדים שלו קטנים מספיק כדי להרים אותו מקומית על שרת ענן פשוט בחצי מחיר.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="google/siglip2-base-patch16-naflex")
print(pipe("שלום"))

הרישיון

רישיון אפאצ'י 2.0 מלא. אפשר להשתמש בו לפרויקטים מסחריים, לשנות את הקוד, להטמיע בתוך מוצר סגור ולהפיץ הלאה. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי של גוגל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗