GPT
T

TIP-I2V

קוד פתוח

WenhaoWangcc-by-nc-4.02024-10-10

  • prompt
  • image-to-video
  • text-to-video
  • visual-generation
  • video-generation

מאגר ראשון מסוגו של מעל 1.70 מיליון שילובי טקסט ותמונות קלט שמשתמשים הזינו למודלי תמונה לוידאו. הוא מתאים למי שרוצה לאמן או להעריך מודלים על סמך פרומפטים אותנטיים וסרטונים שנוצרו בפועל.

  • 3,885הורדות בחודש
  • 24לייקים

מה זה

הרשומות במאגר מייצגות פרומפטים אמיתיים שמשתמשים כתבו, לצד תמונות הקלט שהעלו והסרטונים שנוצרו מהן. החומרים מגיעים מחמישה מודלים שונים: Pika, Stable Video Diffusion, Open-Sora, I2VGen-XL ו־CogVideoX-5B. החוקרים שמרו על לוגו המקור של Pika כדי לתת ייחוס לשירות שממנו הגיעו הנתונים.

המבנה מחולק לשלושה חלקים עיקריים. יש את החלק המלא שכולל מעל 1.70 מיליון רשומות, תת-קבוצה של 100 אלף רשומות, וסט הערכה בשם TIP-Eval עם 10 אלף דגימות. לכל חלוקה כזו אפשר להוריד בנפרד את הטקסט עם תמונות דחוסות, את האמבדינגס של הטקסט והתמונה, קובצי תמונה מקוריים ללא דחיסה, ואת הסרטונים שנוצרו בפועל.

מתאים ל

  • הערכת ביצועי מודלים

    הרצת סט ההערכה TIP-Eval על מודל תמונה לוידאו חדש ובדיקת איכות התוצאות מול חמישה מודלים קיימים.

  • ניתוח העדפות משתמשים

    חקר דפוסי הניסוח ותמונות הקלט שמשתמשים אמיתיים בוחרים כשהם מנסים לייצר סרטונים.

  • מחקר בטיחות ודיסאינפורמציה

    זיהוי פרומפטים בעייתיים שעלולים לייצר תוכן מטעה בטכנולוגיות יצירת וידאו מתמונה.

איפה זה נופל

הטקסטים במאגר נאספו באנגלית בלבד. אם המוצר שלכם פונה לקהל מקומי בעברית, הנתונים האלה לא יסייעו בבדיקת הבנת שפה או סלנג ישראלי בלי תרגום או התאמה מראש.

הסרטונים המלאים של Pika כוללים את סימן המים של השירות, מה שעלול לחלחל למודלים שמאומנים עליהם. בנוסף, מדובר בפרומפטים פתוחים של משתמשי קצה, כך שסכנות של דיסאינפורמציה ותוכן מוטה קיימות במידע הגולמי, והחוקרים אף מציינים את הצורך בחקר בטיחות סביב הנושאים האלה לפני שמשלבים נתונים כאלה במוצר סופי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0 שמונע במפורש כל פעילות מסחרית. מותר להשתמש בנתונים רק למחקר, ניסויים פנימיים או פיתוח אקדמי.

כמה נפח אחסון צריך בשביל להוריד את הנתונים?

זה תלוי מה מורידים. קובצי הטקסט והתמונות הדחוסות של החלק המלא שוקלים כ־13.4G, אך תמונות המקור הלא דחוסות תופסות כ־1T, וסרטוני Pika המלאים דורשים כ־1T נוסף. לניסויים קלים עדיף להשתמש בסט Eval ששוקל ג'יגה-בייטים בודדים.

האם יש בדאטהסט פרומפטים בעברית?

לא, המאגר מתועד כשפה האנגלית בלבד. כל הפרומפטים שנאספו ממשתמשי הקצה כתובים באנגלית, כך שאין כאן מענה ישיר לבדיקת תוכן או אימון בשפה העברית.

מאיפה הגיעו הנתונים של המאגר?

היוצרים אספו מעל 1.70 מיליון פרומפטים ותמונות קלט שמשתמשים סיפקו. את הסרטונים הם יצרו באמצעות חמישה מודלים מובילים: Pika, Stable Video Diffusion, Open-Sora, I2VGen-XL ו־CogVideoX-5B.

איך טוענים

טעינת המידע הבסיסי נעשית ישירות דרך ספריית datasets באמצעות ציון שם המאגר והחלק המבוקש, כמו Full, Subset או Eval. מומלץ להפעיל מצב streaming כי פריסה מלאה של הנתונים לפנדס כבדה וממלאת את הזיכרון.

אם אתם צריכים רק את האמבדינגס, אפשר להוריד קובצי parquet ישירות מהמאגר דרך huggingface_hub. תמונות המקור הלא דחוסות והסרטונים של Pika מחולקים לארכייוני tar מרובים, כך שהורדה מלאה שלהם דורשת סקריפט ייעודי שמוריד עשרות קבצים כבדים ברצף.

from datasets import load_dataset

ds = load_dataset("WenhaoWang/TIP-I2V")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0. המשמעות פשוטה: השימוש מותר למטרות מחקר, בדיקה ולימוד בלבד, ואסור לכל שימוש מסחרי. חובה לתת ייחוס ליוצרים. אם תאמנו מודל על הנתונים האלה, לא תוכלו למכור גישה אליו או להטמיע אותו במוצר שמייצר הכנסות לחברה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗