GPT
V

VidProM

קוד פתוח

WenhaoWangcc-by-nc-4.02024-02-25

  • prompts
  • text-to-video
  • text-to-image
  • Pika
  • VideoCraft2

המאגר מרכז 1.67 מיליון פרומפטים אמיתיים ליצירת וידאו לצד 6.69 מיליון סרטונים שנוצרו בארבעה מודלים שונים. הוא מתאים למי שחוקר פרומפטים לווידאו או מפתח זיהוי תוכן סינתטי.

  • 19,405הורדות בחודש
  • 82לייקים

מה זה

הנתונים מבוססים על הודעות שנאספו משרת הדיסקורד הרשמי של Pika באמצעות כלי הגירוד DiscordChatExporter. החוקרים חילצו משם פרומפטים אמיתיים של משתמשים וייצרו בעזרתם סרטונים בארבעה מודלי דיפוזיה שונים: Pika, VideoCrafter2, Text2Video-Zero ו־ModelScope.

הרשומות הטקסטואליות מאורגנות בקובצי טבלאות. הקובץ המרכזי מכיל מזהה ייחודי, טקסט הפרומפט, חותמת זמן ושש עמודות עם הסתברויות לתוכן פוגעני או מיני, כמו רעילות, עלבונות ותכנים מיניים מפורשים. קיים גם קובץ ייעודי שמסנן כפילויות סמנטיות.

לצד הטבלאות, המאגר מחזיק קובץ HDF5 עם וקטורי שיכון באורך 3072 ממדים שנוצרו דרך מודל text-embedding-3-large של OpenAI. הסרטונים עצמם מפוצלים לארבע ספריות נפרדות לפי מודל המקור, כשכל מודל מחולק לשלושים קובצי ארכיון דחוסים בפורמט tar.

מתאים ל

  • הנדסת פרומפטים לווידאו

    ניתוח אופן הניסוח של משתמשים והשפעתו על איכות התוצר בארבעה מודלי דיפוזיה שונים.

  • זיהוי וידאו סינתטי

    אימון ובדיקת מסווגים שמבדילים בין סרטונים מרונדרים לבין מקורות אחרים.

  • אימון מודלי אחזור סמנטי

    שימוש בווקטורי השיכון הקיימים ובטקסטים כדי לבנות מנועי חיפוש לקטעי וידאו.

איפה זה נופל

כל הפרומפטים נאספו מקהילת משתמשים אחת בדיסקורד והטקסט כולו באנגלית, כך שאין כאן ייצוג לעברית או לדפוסי שימוש בממשקים עסקיים אחרים. חותמות הזמן מציגות דגימות מסוף שנת 2023. הנתונים אמנם כוללים ציוני בטיחות לתוכן רעיל או מיני, אך הטקסטים והסרטונים עדיין עשויים לכלול תוכן לא הולם שמחייב סינון עצמאי לפני הזנה למערכות פרודקשן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח כלי מסחרי?

לא. הפרומפטים, הסרטונים של פיקה והסרטונים של מודלסקופ שוחררו תחת רישיון לא מסחרי cc-by-nc-4.0. לא הייתי בונה על זה בסיס למודל שמיועד למכירה או לרווח.

האם המאגר כולל תוכן בעברית?

השפה המדווחת בכרטיס היא אנגלית בלבד. הפרומפטים הגיעו משרת דיסקורד בינלאומי אך כולם באנגלית, ולכן המאגר לא מתאים לאימון מודלים ממוקדי שפה מקומית.

איך נאספו הנתונים במקור?

היוצרים הפעילו את כלי הקוד הפתוח DiscordChatExporter כדי לחלץ עמודי HTML שלמים משרת הדיסקורד של Pika. מתוך קבצים אלה חולצו הפרומפטים, שנשלחו לאחר מכן ליצירת סרטונים בארבעה מודלים שונים.

מה ההבדל בין קובצי הטבלאות שבמאגר?

קובץ VidProM_unique מכיל את כלל הפרומפטים הייחודיים עם חותמות הזמן וציוני הבטיחות. קובץ VidProM_semantic_unique מסנן בנוסף גם כפילויות סמנטיות ולא רק התאמות טקסט מדויקות.

איך טוענים

אפשר לטעון את המאגר ישירות עם ספריית datasets בפייתון או להוריד קבצים בודדים ישירות עם wget דרך קישורי הרשת. אין צורך באישור גישה מוקדם, המאגר פתוח לחלוטין. אם אתם צריכים רק את הטקסט, הורידו ישירות את קובצי ה־CSV בעזרת pandas כדי לחסוך עבודה עם הסרטונים הכבדים. כדי לעבוד עם וקטורי השיכון נדרשת ספריית h5py לקריאת קובץ ה־HDF5. אם רוצים לבדוק את המבנה לפני ששואבים עשרות ארכיוני tar, קיימת תיקיית דוגמה עם עשרת אלפים רשומות.

from datasets import load_dataset

ds = load_dataset("WenhaoWang/VidProM")

הרישיון

הפרומפטים והסרטונים של Pika משוחררים תחת רישיון cc-by-nc-4.0, שאוסר על שימוש מסחרי ומחייב מתן קרדיט ליוצרים. סרטוני VideoCrafter2 שוחררו ברישיון Apache, סרטוני Text2Video-Zero ברישיון CreativeML Open RAIL-M, וסרטוני ModelScope ברישיון cc-by-nc-4.0. בפועל, החלקים הלא מסחריים מונעים שימוש בתוצרים לאימון מודל שיימכר כמוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗