GPT
O

Open-Sora-Plan-v1.0.0

קוד פתוח

LanguageBindmit2024-04-06

אפשר גם להריץ אותו בדפדפן בלי להתקין דבר.

מאגר וידאו מקיף עם תיאורי טקסט צפופים שנבנו במיוחד לאימון מודלי יצירת וידאו. הוא מרכז עשרות אלפי סרטונים ללא סימני מים עם תיוג סינתטי מפורט ממודלים רב-מודאליים.

  • 1,310הורדות בחודש
  • 66לייקים

מה זה

המאגר כולל 40,258 סרטונים שנאספו מאתרים שמציעים תוכן ברישיון CC0, עם אורך כולל של כ־274 שעות וחמש דקות. כל הסרטונים נקיים מסימני מים, וכשישים אחוז מתוכם צולמו לרוחב.

התוכן מחולק לפי שלושה מקורות איסוף עיקריים. החלק הגדול ביותר מגיע מפיקסאביי, עם 31,616 סרטונים בהיקף של כמעט 219 שעות. פקסלס מספק 7,408 סרטונים שהם קרוב ל־49 שעות, ומיקסקיט תורם 1,234 סרטונים נוספים בהיקף של קצת יותר משש שעות.

לצד קובצי הווידאו, המאגר כולל תיאורים צפופים שנוצרו באמצעות מודלי תיוג תמונה. היוצרים השוו בין ShareGPT4V-Captioner-7B לבין LLaVA-1.6-34B, ופרסמו את נתוני התיאורים עם אורך ממוצע שנע בין 141 ל־170 תווים או מילים לפי המודל, כאשר רובם המוחלט נחתך באורך מקסימלי של 300.

מתאים ל

  • אימון מודלי טקסט לווידאו

    שימוש בסרטונים הנקיים יחד עם התיאורים הצפופים לאימון מודלי דיפוזיה שמייצרים וידאו.

  • הערכת תיוג וידאו אוטומטי

    בדיקת איכות של מודלי ראייה-שפה מול נתוני התיוג המוכנים של LLaVA ו־ShareGPT4V.

  • אימון מודלים לחלוקת סצנות

    בחינה ופיתוח של מנגנוני זיהוי חיתוכים ומעברים בווידאו בעזרת הכלים המצורפים במאגר.

איפה זה נופל

התיאורים הטקסטואליים נוצרו כולם על ידי מודלי שפה ותמונה ולא בידי אדם, מה שעלול להכניס הזיות או חזרתיות בטקסט. המאגר מבוסס רק על שלושה אתרי תמונות וסרטונים חינמיים, כך שהתוכן נוטה לסגנון מלאי סטנדרטי ולאו דווקא לתנועות מורכבות או אירועים מהחיים האמיתיים. בנוסף, אין במאגר שום ייצוג לשפות שאינן אנגלית, ואין נתונים על תוכן מקומי או ישראלי.

אותה משפחה

Open-Sora-Plan יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן. הדאטהסט עצמו ברישיון MIT, והווידאו נאסף ממקורות ברישיון CC0. מותר להשתמש במידע כדי לאמן מודלים מסחריים או לשלב אותו במוצרים.

האם יש במאגר סרטונים עם כתוביות או דיבור בעברית?

לא. הסרטונים מגיעים מאתרי מדיה בינלאומיים של סרטוני אווירה, והתיאורים נוצרו באנגלית בלבד באמצעות מודלי שפה.

כמה שעות וידאו המאגר מכיל בפועל?

המאגר כולל 40,258 סרטונים באורך כולל של כ־274 שעות וחמש דקות. רוב הווידאו מגיע מפיקסאביי, וחלקים קטנים יותר מפקסלס וממיקסקיט.

איך נוצרו התיאורים של הסרטונים?

החוקרים השתמשו במודלי ראייה רב-מודאליים כדי להפיק תיאורים צפופים באופן אוטומטי. הם השוו בין ביצועי המודל הייעודי ShareGPT4V-Captioner-7B לבין המודל הכללי LLaVA-1.6-34B.

איך טוענים

הגישה למאגר פתוחה ואינה דורשת אישור מיוחד. המאגר מכיל 44 קבצים וכולל נתוני תיוג לצד סקריפטים לחלוקת סצנות. לפי התיעוד, חיתוך מעברים נעשה בעזרת כלי מבוסס panda-70m, ולסרטונים ללא מעברים מסופק סקריפט ייעודי שמריצים בסביבת פייתון 3.8. העבודה דורשת שכפול של המאגר וקריאה לקובצי ה־JSON שמכילים את נתיבי הווידאו.

from datasets import load_dataset

ds = load_dataset("LanguageBind/Open-Sora-Plan-v1.0.0")

הרישיון

המאגר מפורסם תחת רישיון MIT, וסרטוני המקור נאספו מאתרים תחת רישיון CC0. השילוב הזה מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי והפצה, בלי חובת שיתוף באותו רישיון. אפשר לאמן עליו מודלים מסחריים בלי לחשוף את הקוד שלכם, כל עוד שומרים על הודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗