GPT
S

siglip2-giant-opt-patch16-384

קוד פתוח

googleapache-2.02025-02-17

  • transformers
  • safetensors
  • siglip
  • vision
  • zero-shot-image-classification

מקודד ראייה וטקסט ענק מבית גוגל שמיועד לסיווג תמונות ללא אימון מוקדם ושליפת מידע. הוא מביא הבנה סמנטית עמוקה במיוחד, אבל דורש חומרה רצינית.

  • 1.9Bפרמטרים
  • 7.0 GBמשקל הקבצים
  • 2,561,481הורדות בחודש
  • 44לייקים

מה זה

גוגל לקחו את ארכיטקטורת SigLIP ושדרגו את מטרות האימון שלה כדי לשפר הבנה של פרטים מקומיים, סמנטיקה ומאפיינים צפופים. המודל הנוכחי אומן על מאגר WebLI תוך שימוש במטרות פענוח וחיזוי מוסתר, מה שמאפשר לו להבין קשרים עדינים בין תיאור טקסטואלי לבין מה שמופיע בפיקסלים ברזולוציה של 384x384.

הוא מיועד בעיקר לחיפוש תמונות לפי טקסט, סיווג לפי תוויות חופשיות, או כבסיס ראייה למודלים מולטימודליים גדולים יותר. עם קרוב לשני מיליארד פרמטרים, הדגש כאן הוא על דיוק מקסימלי במשימות ויזואליות מורכבות על חשבון קלות משקל.

מתאים ל

  • חיפוש תמונות לפי טקסט

    חילוץ וקטורים מתמונות ומטקסט לצורך מנועי חיפוש ויזואליים מדויקים.

  • סיווג תמונות ללא אימון

    בדיקת שיוך של תמונות לרשימת תוויות טקסטואליות משתנה בזמן אמת.

  • מקודד ראייה למודלי שפה

    חיבור המודל כמגדל ראייה ראשי עבור מערכות שפה רב אופניות.

איפה זה נופל

זהו אינו מודל שמייצר טקסט או עונה על שאלות בצורה פתוחה, אלא רק מקודד שמחזיר וקטורים או התאמות בין תוויות קיימות. אימונו בוצע על מאגר WebLI, מה שאומר שהבנת שפות שאינן אנגלית ועולם המושגים שלו תלויים לחלוטין במה שנאסף מהרשת באותו מאגר. בנוסף, חלוקת התמונה לטלאים של 16 פיקסלים ברזולוציית 384 מגבילה את היכולת לתפוס פרטים זעירים מאוד.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב אישי רגיל ללא כרטיס מסך ייעודי?

ההרצה על מעבד בלבד אפשרית טכנית דרך transformers, אבל היא תהיה איטית ביותר בגלל גודל של קרוב לשני מיליארד פרמטרים. לשימוש שוטף חובה כרטיס גרפי מתאים.

האם המודל מסוגל לענות על שאלות בצורה חופשית כמו צ'אט?

לא, הוא אינו מודל שיחה. הוא מחזיר ציוני התאמה בין תמונה למחרוזות טקסט או וקטורים נומריים שמייצגים את התמונה, ואינו מחולל טקסט חדש בעצמו.

איך מריצים

המשקל הכולל של הקבצים עומד על 7 גיגה בייט, מה שאומר שבשביל להריץ אותו בזמן תגובה סביר תצטרכו כרטיס מסך עם לפחות 12 עד 16 גיגה בייט זיכרון רק למודל עצמו ולעיבוד הקלטים. ההרצה נעשית ישירות דרך ספריית transformers בפייתון באמצעות צינורות עבודה מובנים לסיווג תמונות או חילוץ מאפיינים ישיר.

אם אתם צריכים לסווג כמה תמונות פה ושם ולא מחזיקים שרת ייעודי, עדיף להשתמש בנקודת קצה מנוהלת דרך ענן. להחזיק מאיץ גרפי ייעודי רק בשביל המודל הזה שווה רק אם יש לכם זרם רציף של תמונות לעיבוד מקומי ומיידי.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="google/siglip2-giant-opt-patch16-384")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה פנימית או מסחרית, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗