GPT
S

seedance-2-prompts-datasets

קוד פתוח

GokuScrapercc-by-4.02026-05-02

  • video-prompt
  • seedance-2
  • prompt-engineering
  • prompt-dataset
  • video-generation

מעל שמונת אלפים פרומפטים שחוברו למודל הווידאו Seedance 2.0 של בייטדאנס, כולל קבצי וידאו ותמונות מקדימות. הוא מתאים למי שחוקר התאמת טקסט לווידאו וצריך דוגמאות מובנות.

  • 203,035הורדות בחודש
  • 44לייקים

מה זה

המאגר מכיל מעל שמונת אלפים ומאה רשומות שמחברות בין פרומפטים לבין תוצרי הווידאו שנוצרו בפועל. כל רשומה כוללת את טקסט ההנחיה, מטא דאטה מובנה, סרטון בפורמט MP4 ותמונת שער בפורמט JPG שמציגה פריים מקדים. הנתונים מאורגנים בקובץ metadata.jsonl מרכזי שמקשר בין הטקסט לנתיבי הקבצים השונים באחסון.

הצוות שפרסם את החומר אסף את הפרומפטים מקהילות פתוחות ברשת ולא ישירות מבייטדאנס. המטרה המוצהרת שלהם היתה לקחת טקסטים מפוזרים מהאינטרנט ולהמיר אותם לפורמט אחיד ונוח לעיבוד תוכנתי. הם לא מפרטים על תהליך סינון ידני או בדיקות איכות מיוחדות מעבר לאיסוף, ארגון במבנה אחיד והעלאת הקבצים לתצוגה ציבורית.

בתוך המאגר יש כמעט עשרים אלף קבצים שונים שמחולקים בין קובץ המטא דאטה לבין תיקיות המדיה של תמונות השער והסרטונים. הטקסטים עצמם מופיעים בשתי שפות בלבד, אנגלית וסינית, בהתאם לפלטפורמות שמהן נגרדו הנתונים המקוריים.

מתאים ל

  • אימון מודלי טקסט לווידאו

    שימוש בזוגות של פרומפטים וסרטונים כבסיס לכיול או לאימון מודלים מחוללים.

  • ניתוח הנדסת פרומפטים

    בדיקה אילו מבנים לשוניים באנגלית ובסינית מייצרים תוצאות וידאו טובות יותר.

  • הערכת ביצועי מודלים

    הרצת הפרומפטים על מודלים מתחרים כדי להשוות איכות תנועה ונאמנות להנחיה.

איפה זה נופל

הנתונים מוגבלים לחלוטין לאנגלית ולסינית, כך שאין שום ייצוג לעברית או לשפות אחרות. מעבר לזה, המקור הוא גרידה מקהילות אינטרנט ציבוריות, מה שמביא איתו הטיות תוכן לא מבוקרות, פרומפטים שחזרו על עצמם ואיכות הפקה משתנה. הכרטיס אינו מציין סינון של תוכן פוגעני או רעיל, וחובה לבדוק ידנית את איכות הטקסטים והסרטונים לפני שמכניסים אותם לאימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון המדווח הוא cc-by-4.0 שמתיר שימוש מסחרי בכפוף למתן קרדיט. יחד עם זאת, היוצרים מציינים שהתוכן נגרד מהרשת וזכויות התוכן המקורי שייכות למי שיצר אותו, כך שנדרשת זהירות משפטית.

כמה שוקל הדאטהסט המלא?

המאגר כולו שוקל מעל חמישים גיגה בייט. רוב הנפח מגיע מסרטוני ה MP4 ותמונות השער, בעוד שקובץ הטקסט עצמו קטן בהרבה ונטען במהירות.

האם יש תמיכה בעברית?

לא. כל הפרומפטים נאספו באנגלית ובסינית בלבד, בהתאם לקהילות המשתמשים של המודל.

איך המידע נאסף?

הנתונים נאספו בצורה אוטומטית מקהילות אינטרנט פתוחות שמפרסמות יצירות של Seedance 2.0. המפרסם סידר את הטקסטים במבנה אחיד וחיבר אותם לקבצי המדיה שנוצרו.

איך טוענים

טעינת המטא דאטה פשוטה מאוד ולא דורשת אישור גישה מיוחד. אפשר למשוך ישירות את קובץ ה metadata.jsonl מקוון לתוך פנדס בפייתון בשורת קוד אחת ולקבל מיד את כל ההנחיות והפרמטרים. אם אתם רוצים את כל המדיה, קחו בחשבון נפח של מעל חמישים גיגה בייט שכולל קבצי MP4 ו JPG רבים, כך שכדאי להוריד רק את הקישורים הדרושים במקום למשוך את כל התיקיות מראש.

from datasets import load_dataset

ds = load_dataset("GokuScraper/seedance-2-prompts-datasets")

הרישיון

המאגר מופץ ברישיון cc-by-4.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ מחדש, בתנאי שנותנים קרדיט מתאים ליוצרים. המפרסמים מדגישים שזכויות היוצרים על התוכן המחולל המקורי שייכות ליוצרים ברשת, והם עצמם אחראים רק על האיסוף והמבנה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗