GPT
S

Sa2VA-4B

קוד פתוח

ByteDanceapache-2.02025-01-07

  • transformers
  • safetensors
  • sa2va_chat
  • feature-extraction
  • Sa2VA

חיבור ישיר בין SAM 2 להבנת שפה ותמונה שמייצר מסכות סגמנטציה מדויקות לתמונות ולווידאו. הוא פותר את הצורך להריץ מודל שיחה ומודל חיתוך בנפרד.

  • 3.9Bפרמטרים
  • 14.1 GBמשקל הקבצים
  • 2,117הורדות בחודש
  • 99לייקים

מה זה

המודל הזה לוקח את InternVL2.5-4B עם מנוע שפה של Qwen2.5-3B-Instruct ומחבר אותם לארכיטקטורה של SAM 2. במקום להסתפק בתיאור טקסטואלי של מה שמופיע בפריים או בסימון קופסאות, הוא מחזיר חיתוך צפוף של אובייקטים לפי הנחיות טקסט או נקודות ויזואליות.

התוצאות במבחני חיתוך תמונות כמו RefCOCO עומדות על 82.4, ובמבחני וידאו כמו DAVIS הוא מגיע ל־73.7, מספרים שקרובים מאוד לגרסאות הגדולות שלו ב־8B ו־26B. הוא עונה על שאלות ברמה דומה למודלי ראייה מקבילים, אבל מוסיף להם את היכולת לסמן פיקסלים מדויקים גם ברצף פריימים של וידאו.

מתאים ל

  • חיתוך אובייקטים בווידאו

    סימון ועקיבה אחרי עצמים לפי טקסט חופשי בווידאו קיים, הודות לשילוב עם SAM 2.

  • תיוג ויזואלי מבוסס שיחה

    הפקת מסכות סגמנטציה מדויקות ישירות מתוך שאלות ותשובות על תמונות.

  • הבנת פקודות הצבעה

    זיהוי ופילוח אובייקטים לפי הנחיות ויזואליות כמו קליק או נקודה בפריים.

איפה זה נופל

למרות שהוא שומר על ציונים יפים בווידאו, מבחן MeVIS מציג ציון של 55.9, מה שאומר שבמעקב אחרי אובייקטים מורכבים שנעלמים וחוזרים בווידאו הוא עדיין מפספס לא מעט. בנוסף, חיתוך צפוף של וידאו הוא תהליך כבד מאוד מבחינת זמני תגובה, כך שזה לא יעבוד לכם בזמן אמת בלי התאמות רציניות.

אותה משפחה

Sa2VA יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות דרך קוד של transformers?

כן, המודל משתמש במחלקת Sa2VAChatModel ונתמך ישירות דרך הספרייה הרגילה של transformers. תצטרכו להוריד את 14.1 הגיגה בייט של המשקלים ולטעון אותם למעבד גרפי מתאים.

האם יש הבדל משמעותי בינו לבין גרסת ה־8B?

במבחני חיתוך תמונה ההבדל זניח, עם 82.4 בגרסה הזו מול 82.6 ב־8B. הפער מורגש קצת יותר במעקב וידאו מורכב ובהבנת טקסט, אבל לרוב השימושים גרסת ה־4B נותנת יחס ביצועים למשאבים עדיף בהרבה.

איך מריצים

המשקלים תופסים 14.1 גיגה בייט ומגיעים בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 16 גיגה בייט זיכרון כדי לטעון אותו ולהריץ הסקת מסקנות בסיסית, רצוי 24 גיגה בייט כדי לטפל בקטעי וידאו ארוכים בלי לקרוס מחוסר זיכרון. הטעינה נעשית ישירות דרך ספריית transformers.

אם אתם צריכים רק שאלות ותשובות על תמונות בלי סגמנטציה, אין טעם להרים אותו עצמאית ועדיף לפנות ל־API סטנדרטי של ראייה. הריצה המקומית משתלמת כשחייבים להוציא מסכות חיתוך מדויקות או כשמעבדים וידאו פנימי שלא רוצים להוציא החוצה לענן חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ByteDance/Sa2VA-4B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצרים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗