GPT
T

tipsv2-b14

קוד פתוח

googleapache-2.02026-04-09

  • transformers
  • safetensors
  • tipsv2
  • feature-extraction
  • vision

מודל ראייה ושפה קל שמחבר בין תמונות לטקסט עם הבנה מרחבית מפורטת של אזורים בתוך התמונה, ומאפשר סיווג ופילוח מהירים בלי אימון מחדש.

  • 196Mפרמטרים
  • 64טוקנים בהקשר
  • 748 MBמשקל הקבצים
  • 219,706הורדות בחודש

מה זה

גוגל שחררו כאן מודל קונטרסטיבי שמורכב משני חלקים, מקודד תמונה מבוסס ViT עם 86 מיליון פרמטרים ומקודד טקסט של 110 מיליון פרמטרים. במקום להסתפק בהבנה כללית של כל התמונה כמקשה אחת, הוא מייצר במקביל ייצוג עולמי וייצוגים נפרדים לכל מקטע של 14 על 14 פיקסלים. זה מאפשר לזהות איפה נמצא כל עצם ולא רק האם הוא מופיע בפריים.

המשקל הכולל יושב על פחות מגיגהבייט אחד, מה שהופך אותו לגרסת הבסיס הקלה בסדרה. בניגוד למודלים כבדים שמצריכים חומרה ייעודית, הוא מספק וקטורים של 768 ממדים שמתאימים מיד לחישובי דמיון מול טקסט, חיפוש סמנטי, או הזנה לראשי פענוח מרחביים כמו סגמנטציה.

מתאים ל

  • סיווג תמונות מהיר

    זיהוי קטגוריות בלי אימון מוקדם, ישירות על ידי השוואת וקטור התמונה לרשימת תוויות טקסטואליות.

  • פילוח ראשוני של עצמים

    שימוש בטוקנים המרחביים כדי לאתר איפה בדיוק נמצא אובייקט מסוים בתוך הפריים.

  • חיפוש תמונות לפי טקסט

    המרת תמונות ושאילתות טקסט קצרות למרחב וקטורי משותף לצורך אחזור מהיר ממאגר מקומי.

איפה זה נופל

מגבלת הטקסט כאן עומדת על 64 טוקנים בלבד, כך שאי אפשר להזין תיאורים מורכבים, פסקאות ארוכות או מסמכים שלמים, והוא מיועד למילים בודדות או משפטים קצרים מאוד. הטוקנייזר מנרמל לאותיות קטנות באנגלית, מה שעלול לפגוע בהבחנה של שמות פרטיים ספציפיים. בנוסף, חילוץ המקטעים המרחביים מוציא כמות גדולה של וקטורים לכל תמונה, מה שדורש ניהול זיכרון נכון אם מנתחים אלפי תמונות ברצף.

שאלות
נפוצות

איזה עיבוד מקדים התמונות צריכות?

צריך לשנות את הגודל לריבוע כמו 448 על 448 ולהמיר לטנסור בטווח שבין 0 ל־1. אין צורך בנרמול הרגיל של ImageNet עם ממוצע וסטיית תקן.

האם הוא יודע לקרוא טקסט בעברית?

הכרטיס מציין טוקנייזר של סנטנספיס עם מעבר לאותיות קטנות שכוון לאנגלית. סביר להניח שסיווג בעברית לא יעבוד טוב ללא תרגום מקדים לאנגלית.

איך מריצים

המודל שוקל 748 מגהבייט בלבד, כך שאפשר להריץ אותו בלי מאמץ על כל כרטיס מסך בסיסי עם 2 או 4 גיגהבייט זיכרון, ואפילו ישירות על מעבד רגיל בשרת פשוט. הטעינה נעשית דרך ספריית transformers עם trust_remote_code מופעל, והעיבוד דורש רק חלוקה לרמת ערכים של אפס עד אחד בלי נירמול של אימג'נט.

אם אתם צריכים דיוק מרחבי גבוה במיוחד, יש למשפחה הזו גרסאות גדולות יותר כמו L/14 או SO400m שמגיעות עד יותר ממיליארד פרמטרים, אבל הן דורשות הרבה יותר זיכרון. במקרה של הרצת מודל הבסיס הנוכחי, אין שום סיבה לשלם על קריאות API חיצוניות, פשוט מחזיקים אותו מקומית בזיכרון ומקבלים זמני תגובה נמוכים מאוד.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="google/tipsv2-b14")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצרים פנימיים או פתוחים ולהפיץ אותו, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗