GPT
A

action100m-preview

קוד פתוח

facebookfair-noncommercial-research-license2026-01-14

  • video
  • action

מאגר שמספק תיוגים צפופים ומרובדים לקטעי וידאו של הדרכות מהרשת. הוא מיועד למי שצריך תיאורי פעולות מפורטים לפי זמנים מדויקים לאימון מודלי וידאו.

  • 1,091הורדות בחודש
  • 150לייקים

מה זה

המאגר מציג תצוגה מקדימה של עשרה אחוזים מתוך פרויקט רחב יותר, שנבנה על בסיס 1.2 מיליון סרטוני הדרכה מיוטיוב באורך כולל של מעל 14 שנים. כל רשומה מייצגת סרטון שלם ומכילה מזהה יוטיוב, מטא דאטה כמו כותרת ותמלול דיבור, ומערך היררכי של מקטעים בזמן.

המקטעים עצמם מאורגנים במבנה עץ לפי רמות פירוט, מקטעים ארוכים וכלליים ועד תתי פעולות קצרות. התיאורים לא נכתבו בידי אדם, אלא נוצרו באמצעות מודלים כמו PLM-3B, LLaMA 3.2 Vision 11B וניתוחי GPT, שחילצו פעולות, שמות עצם של מבצעי הפעולה, והוראות ביצוע מפורטות לכל חלקיק זמן.

מתאים ל

  • אימון הבנת וידאו

    לימוד מודלים לזהות פעולות מורכבות ורצפי צעדים מתוך סרטוני הדרכה ארוכים.

  • יצירת כתוביות לפי זמן

    בניית מנגנונים שמפיקים תיאורי פעולה מדויקים לפי שניות מוגדרות בתוך הקובץ.

  • מידול סביבה ופעולה

    מחקר על הקשר בין פעולות אנושיות, תוצאותיהן ומבצע הפעולה על ציר הזמן.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים לחלוטין על סרטוני הדרכה מיוטיוב, כך שאין כאן ייצוג לעברית, לשיחות יומיומיות, או לסביבות שאינן הדגמת פעולות שלב אחר שלב. מעבר לזה, כל התיוגים והתיאורים מבוססים על מודלי שפה וראייה מלאכותיים. הזיות של מודלים, תיאורי פעולות שגויים או זיהוי לא מדויק של שחקנים הם חלק מובנה מהמידע שחובה לקחת בחשבון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא לשימוש מחקרי לא מסחרי בלבד מטעם מטא. אי אפשר לאמן עליו מודלים שמיועדים למכירה או לשימוש מסחרי בחברה.

האם קובצי הווידאו עצמם כלולים בהורדה?

לא, המאגר כולל אך ורק קובצי parquet עם מטא דאטה, תמלולים, זמנים ותיוגים טקסטואליים. כדי לצפות בווידאו או לעבד את הפריימים, עליכם להוריד את הסרטונים מיוטיוב לפי שדה video_uid.

האם יש במאגר תוכן בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל הטקסטים, התמלולים ותיאורי הפעולות שחולצו הם באנגלית.

מה הגודל של המאגר הזה ביחס לפרויקט המלא?

הגרסה הזו היא preview שמהווה כעשרה אחוזים מסך המידע של Action100M. היא מחולקת ל 122 קובצי parquet ומכילה מיליוני מקטעים מתוך המאגר המלא.

איך טוענים

טוענים את המידע ישירות מקובצי parquet באמצעות ספריית datasets בפייתון, כשרצוי לעבוד במצב streaming בגלל הנפח. המאגר מפוצל ל 122 קבצים ומכיל עשרות מיליוני רשומות מקטעים, כך שהורדה מלאה תדרוש אחסון משמעותי.

המבנה נשען על המערך הפנימי של nodes, שבו שמורים זמני ההתחלה והסיום בשניות, לצד מזהה הסרטון המקורי. שימו לב שהמאגר אינו מכיל את קובצי הווידאו עצמם אלא רק את התיוגים, ותצטרכו להוריד את הווידאו מיוטיוב באופן עצמאי לפי המזהים.

from datasets import load_dataset

ds = load_dataset("facebook/action100m-preview")

הרישיון

המאגר שוחרר תחת fair-noncommercial-research-license. מדובר ברישיון מחקרי לא מסחרי של מטא, שאוסר במפורש כל שימוש במידע למטרות רווח או שילוב שלו במוצר מסחרי. מודל שתאמנו על הדאטהסט הזה מוגבל לצורכי מחקר בלבד ולא תוכלו למכור שירותים המבוססים עליו.

הרישיון המלא ב־Hugging Face ↗