GPT
E

EdgeTAM-hf

קוד פתוח

yonigozlanapache-2.02025-09-26

  • transformers
  • safetensors
  • edgetam_video
  • feature-extraction
  • mask-generation

גרסה קלה של SAM 2 למעקב ומקטוע בווידאו, שמיועדת לרוץ ישירות על מכשירי קצה. היא רצה פי 22 מהר יותר מהמקור ומגיעה ל־16 פריימים בשנייה על טלפון.

  • 14Mפרמטרים
  • 53.4 MBמשקל הקבצים
  • 35,807הורדות בחודש
  • 72לייקים

מה זה

המודל הזה לוקח את היכולות של SAM 2 למקטוע תמונות ווידאו לפי נקודות, קופסאות חוסמות או מסכות קודמות, ומכווץ אותן לממדים מינימליים. עם פחות מ־14 מיליון פרמטרים ומשקל קבצים של כ־53 מגה-בייט, מדובר במשקל נוצה לעומת מודלי מקטוע רגילים.

הוא מסוגל לעקוב אחרי כמה אובייקטים במקביל לאורך פריימים, לקבל נקודות תיקון תוך כדי תנועה, ולעבוד בסטרימינג על וידאו בזמן אמת. המדידות מראות קצב של 16 פריימים בשנייה על אייפון 15 פרו מקס בלי קוונטיזציה, מה שאומר שאפשר להגיע לביצועים שמישים על חומרת מובייל בלי לאבד דיוק בהמרות מסובכות.

מתאים ל

  • מעקב וידאו במובייל

    מאפשר לבודד אובייקטים בזמן אמת ישירות באפליקציות טלפון בלי לשלוח וידאו כבד לשרת.

  • סימון אוטומטי של דאטה

    מייצר מסכות לאובייקטים בלחיצת כפתור מקומית, בלי עלויות ענן או זמני המתנה ארוכים.

  • עריכת וידאו אינטראקטיבית

    קולט נקודות תיקון ומעדכן מסכות תוך כדי עבודה בסטרימינג בזמן אמת.

איפה זה נופל

המחיר של מהירות וגודל זעיר הוא כמעט תמיד פגיעה בדיוק של קצוות עדינים ואובייקטים מורכבים במיוחד ביחס למודל המלא. הכרטיס מציג דוגמאות לתיקונים ידניים בעזרת לחיצות נוספות על פריימים מתקדמים, מה שמעיד על כך שבמעקב ארוך בווידאו האובייקט עלול להימרח או להיאבד ללא התערבות. חובה לבדוק אותו על סוג הווידאו הספציפי שלכם כדי לוודא שהוא שומר על המסכה בתנועות מהירות.

שאלות
נפוצות

איך המודל מתמודד עם מעקב אחרי כמה עצמים בו-זמנית?

הוא תומך בעיבוד באצ' של מספר אובייקטים בכל פריים או בכל התהליך. אפשר להגדיר נקודות שונות לכל אובייקט בנפרד, והוא מנהל את המעקב שלהם במקביל באותו סשן וידאו.

האם חייבים GPU חזק בשביל להריץ אותו?

ממש לא. עם 14 מיליון פרמטרים ומשקל של 53 מגה-בייט, הוא תוכנן מראש למעבדי קצה של מכשירים ניידים ומסוגל לרוץ ישירות על טלפון בקצב שמיש.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון, בין אם דרך pipeline של mask-generation לזיהוי אוטומטי או דרך ממשק מעקב וידאו ייעודי שמנהל סשן. בגלל הגודל הזעיר, אין צורך בשרתי ענן כבדים, וכרטיס מסך בסיסי או מעבד גרפי מקומי במכשיר נייד יספיקו בהחלט.

אין סיבה לשלם ל־API חיצוני על חיתוך וידאו כשיש מודל ששוקל עשירית מגודל של אפליקציה ממוצעת. אתם פשוט מריצים אותו מקומית על החומרה של המשתמש או על שרת פנימי קטן וחוסכים השהיות רשת ותשלום על תעבורה.

from transformers import pipeline

pipe = pipeline("mask-generation", model="yonigozlan/EdgeTAM-hf")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 53.4 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לגמרי, כולל שימוש מסחרי מלא, שינוי הקוד והפצה פנימית או מסחרית בתוך אפליקציה. התנאים היחידים הם שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובת פתיחת קוד המקור של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗