GPT
O

omega-multimodal

קוד פתוח

omegalabsincmit2024-03-07

  • multimodal
  • AGI
  • video
  • anytoany

מאגר וידאו וטקסט שנאסף מיוטיוב על ידי כורי רשת ביטנסור. הוא כולל חיתוכי זמנים, תיאורים ווקטורי הטמעה מוכנים של ImageBind לווידאו, לאודיו ולתיאור.

  • 11,719הורדות בחודש
  • 60לייקים

מה זה

הרשומות מייצגות קטעי וידאו באורך שתי דקות שנאספו מיוטיוב לפי מונחי חיפוש וקטגוריות מוגדרות מראש. כל שורה בטבלה כוללת מזהי יוטיוב, חותמות זמן להתחלה וסיום, כמות צפיות מקורית, תיאור טקסטואלי, מונח החיפוש שהוביל לסרטון, וצייוני התאמה בין הטקסט לתוכן הווידאו.

האיסוף מתבצע על ידי כורים ברשת המבוזרת של ביטנסור, שמתוגמלים לפי מדדים של שונות ואיכות. המערכת משתמשת במודל ImageBind של מטא כדי לחשב וקטורי ייצוג לווידאו, לאודיו ולטקסט, ומדרגת את הכורים לפי המרחק של הנתון החדש מנתונים קיימים ולפי ההתאמה הסמנטית של התיאור לקטע הווידאו.

מתאים ל

  • אימון מודלים מולטימודליים

    חיבור בין ייצוגי וידאו, אודיו וטקסט במרחב אחיד באמצעות וקטורי ImageBind מוכנים מראש.

  • שליפת וידאו לפי טקסט

    בניית מנועי חיפוש לקטעי וידאו לפי תיאורים חופשיים או מונחי חיפוש עם ציוני התאמה.

  • סיווג קטעי וידאו ואודיו

    שימוש בווקטורי ההטמעה הקיימים לאימון מסווגים מהיר בלי צורך לעבד קובצי וידאו כבדים.

איפה זה נופל

הנתונים מבוססים על גרידה מיוטיוב, כך שסרטונים רבים עלולים להימחק או להפוך לפרטיים עם הזמן ולשבור תהליכי הורדה. הכרטיס אינו מפרט חלוקה לשפות ולא ברור אם קיימים תיאורים או סרטונים בעברית, כאשר רוב שאילתות החיפוש והתיאורים מגיעים באנגלית. בנוסף, המודל מסתמך על וקטורים שחושבו ספציפית ב־ImageBind, מה שמגביל אתכם למרחב הייצוג הזה אם אינכם מתכוונים לחלץ תכונות מחדש מהמקור.

שאלות
נפוצות

האם המאגר כולל את קובצי הווידאו עצמם?

לא. המאגר מכיל מטא-דאטה, זמני התחלה וסיום, מזהי יוטיוב, תיאורים ווקטורי הטמעה שחולצו מראש. אם נדרש הווידאו הגולמי, יש להוריד אותו עצמאית מיוטיוב לפי המזהים.

האם מותר להשתמש במאגר לפרויקט מסחרי?

המאגר עצמו מופץ ברישיון MIT שמאפשר שימוש מסחרי חופשי במטא-דאטה ובווקטורים. אם אתם מורידים את קובצי הווידאו המקוריים מיוטיוב, עליכם לוודא שהשימוש בהם תואם לתנאי השימוש וזכויות היוצרים של יוצרי התוכן.

האם יש במאגר תוכן בעברית?

הכרטיס אינו מציין קיום של תוכן בעברית או תמיכה בריבוי שפות. רוב הנתונים שנאספו ברשת מבוססים על חיפושים ותיאורים באנגלית.

איך הנתונים נאספים ומגיעים למאגר?

האיסוף מתבצע על ידי כורים ברשת המבוזרת של ביטנסור, שמחפשים ומחלצים קטעים מיוטיוב. המערכת מחשבת להם ציוני גיוון והתאמה באמצעות ImageBind ומתגמלת אותם בהתאם.

איך טוענים

המאגר מפוצל לעשרות אלפי קובצי Parquet תחת פיצול train, ללא צורך באישור גישה מיוחד. כדי לטעון אותו בצורה יעילה כדאי להשתמש בסטרימינג או לקרוא רק את העמודות הדרושות, שכן הקבצים כוללים וקטורים מלאים עבור video_embed, audio_embed ו־description_embed שתופסים נפח משמעותי בזיכרון. קובצי הווידאו עצמם אינם שמורים במאגר, אלא רק המטא-דאטה וההטמעות, כך שאם אתם זקוקים לפיקסלים הגולמיים תצטרכו להוריד אותם ישירות מיוטיוב לפי שדות ה־youtube_id, ה־start_time וה־end_time.

from datasets import load_dataset

ds = load_dataset("omegalabsinc/omega-multimodal")

הרישיון

המאגר פורסם תחת רישיון MIT, שמתיר שימוש מסחרי, שינוי והפצה כמעט ללא הגבלה, ומחייב רק שמירה על הודעת זכויות היוצרים המקורית. עם זאת, הרישיון חל על המטא-דאטה והווקטורים שבמאגר. הסרטונים עצמם מגיעים מיוטיוב וכפופים לתנאי השימוש וזכויות היוצרים של בעלי התוכן המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗