GPT
L

LaSOT

קוד פתוח

l-ltרישיון לא דווח2023-06-01

מעקב וידאו אחרי אובייקט יחיד לאורך זמן דורש רצפים ארוכים ותיוג קפדני. המאגר מרכז סרטונים שמגיעים בממוצע ל־2,500 פריימים עם תיוג ידני וטקסטואלי לכל רצף.

  • 4,844הורדות בחודש
  • 15לייקים

מה זה

המאגר מכיל 1,400 רצפי וידאו ומעל 3.5 מיליון פריימים בסך הכל. התוכן מחולק בצורה מאוזנת ל־70 קטגוריות שונות, כשבכל קטגוריה יש בדיוק 20 רצפים. הקטגוריות כוללות עצמים מגוונים כמו מטוסים, דובים, סירות, אופניים וכדורי סל.

כל פריים ברצפים עבר בדיקה ותיוג ידני, ובנוסף לתיחום הוויזואלי של האובייקט, כל רצף כולל גם תיאור שפתי. המאגר מציג גרסת כנס מ־CVPR 2019, כאשר הרצפים בו ארוכים יחסית ועומדים על ממוצע של כ־83 שניות לסרטון. חלוקת הנתונים מוכתבת מראש לפי קובצי אימון ומבחן ייעודיים שמצורפים למבנה התיקיות.

מתאים ל

  • אימון מודלים למעקב עצמים

    למידת עוקבים מבוססי ראייה ממוחשבת על רצפים ארוכים עם שינויי זווית ותנועה מתמשכת.

  • הערכת עמידות במעקב ממושך

    בדיקת ביצועים של מודלים קיימים מול אובדן מטרה בסרטונים של אלפי פריימים.

  • מעקב משולב טקסט ותמונה

    ניצול התיאורים השפתיים הצמודים לכל רצף לפיתוח מערכות מעקב מונחות הוראה מילולית.

איפה זה נופל

הכרטיס לא מפרט מאיזה מקורות רשת נדגמו הסרטונים המקוריים, מה שמשאיר שאלות פתוחות לגבי איכות הדחיסה ותנאי התאורה בעולם האמיתי. בנוסף, מדובר בגרסת הכנס מ־2018 ו־2019, ללא 15 הקטגוריות הנוספות שנוספו מאוחר יותר בגרסת המאמר המורחבת שיושבת במאגר נפרד. התיאורים השפתיים קיימים אך אינם בעברית, והאיזון הקשיח של 20 סרטונים לקטגוריה אינו משקף שכיחות טבעית של עצמים בייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון לא דווח בדף המאגר, ולכן אין היתר שימוש מסחרי מתועד. במצב כזה מומלץ לאמן עליו לצורכי מחקר בלבד, או לפנות לצוות ב־heng.fan@unt.edu כדי להבין את תנאי הקניין הרוחני של הנתונים.

כמה מקום צריך לפנות בדיסק לפני ההורדה?

המאגר כולל 74 קבצים ובהם מעל 3.5 מיליון פריימים של וידאו ברזולוציה מלאה, מחולקים לקובצי zip לפי קטגוריות. המשקל הכולל של כלל הקטגוריות דורש עשרות עד מאות ג'יגה בייט פנויים, במיוחד לאחר חילוץ התמונות.

האם יש במאגר תמיכה בעברית?

לא. התיוגים הטקסטואליים של רצפי הווידאו נכתבו באנגלית בלבד. אם המודל שלכם נשען על הנחיות בעברית, תצטרכו לתרגם את התיאורים באופן עצמאי.

מה ההבדל בין מאגר זה לבין LaSOT-ext?

מאגר זה מציג את גרסת הכנס המקורית עם 70 קטגוריות ו־1,400 סרטונים. הגרסה המורחבת שפורסמה בכתב העת כוללת 15 קטגוריות נוספות עם 150 סרטונים, והיא מנוהלת במאגר נפרד בהאגינג פייס בשם l-lt/LaSOT-ext.

איך טוענים

הורדת הנתונים מתבצעת ישירות מקוד פייתון דרך snapshot_download של ספריית huggingface_hub, או במשיכה ידנית של קובצי zip לפי קטגוריות. אין צורך באישור גישה מיוחד, המאגר פתוח להורדה.

בפועל מדובר ב־74 קבצים שמכילים מיליוני תמונות, כך שנדרש נפח אחסון מקומי משמעותי. לאחר פריקת הארכיונים, המבנה מסתמך על תיקייה לכל קטגוריה ועל הקבצים training_set.txt ו־testing_set.txt שמגדירים את הפיצול ללמידה ולהערכה.

from datasets import load_dataset

ds = load_dataset("l-lt/LaSOT")

הרישיון

בעמוד המאגר לא דווח רישיון כלל. ללא הצהרת רישיון מפורשת או תנאי שימוש מהיוצרים, אסור להניח שהשימוש בו מותר למטרות מסחריות, ויש סיכון משפטי באימון מודלים המיועדים למוצר. חברות וארגונים צריכים לפנות לחוקר האחראי בכתובת המופיעה בפרסום כדי לברר את תנאי ההפצה לפני השימוש.

הרישיון המלא ב־Hugging Face ↗