GPT
S

sam2.1-hiera-large

קוד פתוח

facebookapache-2.02024-09-24

  • transformers
  • safetensors
  • sam2_video
  • feature-extraction
  • mask-generation

פייסבוק שחררו גרסה שמביאה סגמנטציה מדויקת לא רק לתמונות בודדות, אלא גם למעקב אחרי עצמים בתוך וידאו. עם 224 מיליון פרמטרים, זה כלי חזק לחיתוך רציף לאורך פריימים.

  • 224Mפרמטרים
  • 1.7 GBמשקל הקבצים
  • 99,479הורדות בחודש
  • 143לייקים

מה זה

הארכיטקטורה כאן נשענת על Sam2VideoModel, ומציעה מענה מקיף לשתי משימות במקביל, חיתוך עצמים בתמונות ומעקב רציף אחריהם בווידאו. אפשר להזין נקודות לחיצה חיוביות ושליליות, תיחום מלבני, או פשוט לבקש ממנו לייצר מסכות לכל מה שהוא מזהה בפריים. הייחוד של הגרסה הזו מול מודלים רגילים לסגמנטציה הוא היכולת לקבל קלט בפריים אחד, לעקוב אחרי המסכה לאורך זמן, ולתקן אותה בפריימים מאוחרים יותר בלחיצה נוספת.

בגודל של 224M פרמטרים ומשקל קבצים של 1.7 גיגה בייט, מדובר במודל שמסוגל לעבד אובייקטים מרובים במקביל, ואפילו להזרים וידאו בזמן אמת. הקוד הרשמי והתמיכה בספריית transformers מאפשרים לשלב אותו ישירות בצנרת עיבוד קיימת בלי לבנות תשתית מורכבת סביבו.

מתאים ל

  • מעקב וידאו

    מעקב רציף אחרי עצמים נעים בווידאו על בסיס נקודת התחלה ותיקונים ידניים.

  • סגמנטציה אוטומטית

    יצירת מסכות לכל העצמים בתמונה באמצעות קריאה בודדת לצינור mask-generation.

  • עריכה מבוססת תיחום

    בידוד מדויק של עצם מתוך תמונה באמצעות הזנת תיבת גבול מסביבו.

איפה זה נופל

הכרטיס לא מציג נתוני שגיאה רשמיים, אבל האופי של מעקב בווידאו דורש ערנות. כשהאובייקט מוסתר לזמן ממושך או זז מהר מדי, יש סיכוי לאיבוד המעקב או לזליגה של המסכה לרקע. כדי לייצב את התוצאה בווידאו ארוך תצטרכו להזין נקודות תיקון באופן ידני לאורך הפריימים, כך שהתהליך לא תמיד עצמאי לחלוטין.

שאלות
נפוצות

האם המודל תומך בעיבוד וידאו בזמן אמת?

כן, המודל תומך בהזרמת פריימים ומעקב תוך כדי תנועה, לצד יכולת תיקון בפריימים מאוחרים.

האם חייבים כרטיס מסך כדי להשתמש בו?

טכנית אפשר לטעון אותו לזיכרון הראשי, אבל בפועל הרצה יעילה בווידאו או על באצ'ים דורשת כרטיס מסך עם bfloat16.

האם המודל מוגבל לעצם בודד בכל הרצה?

לא, אפשר להזין נקודות ותיחומים למספר אובייקטים בו זמנית ולעקוב אחרי כולם במקביל.

איך מריצים

בפועל אפשר להריץ אותו בשתי דרכים: ישירות דרך החבילה הרשמית sam2 או באמצעות הצינורות המוכנים של transformers בפייתון. הקבצים שוקלים כ־1.7 גיגה בייט בפורמט float32, כך שכרטיס מסך מודרני עם תמיכה ב־bfloat16 יריץ אותו בקלות מקומית. אם אתם עובדים עם וידאו ארוך או באצ'ים כבדים, כדאי להחזיק כרטיס עם מספיק זיכרון כדי לנהל את מצב המעקב בין הפריימים.

אם אין לכם כרטיס מסך ייעודי בשרת או שהמטרה היא רק ניסוי נקודתי על תמונה פה ושם, עדיף להשתמש בפתרון ענן קיים. למי שבונה מוצר שדורש עיבוד וידאו רציף ומעקב בזמן אמת, הרצה עצמית של המודל הזה על שרת פרטי תיתן שליטה מלאה בביצועים ובזיכרון.

from transformers import pipeline

pipe = pipeline("mask-generation", model="facebook/sam2.1-hiera-large")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית במוצר שלכם. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗