GPT
R

ReCo-Data

קוד פתוח

HiDream-aicc-by-nc-sa-4.02025-12-12

  • Video-Text-to-Video
  • Video-to-Video
  • Video Edit
  • Video

מעל חצי מיליון זוגות של סרטונים והוראות טקסט לעריכת וידאו מונחית. המאגר מציע חלוקה מובנית לארבע פעולות עריכה מדויקות שנוצרו בצינור סינתטי מבוקר.

  • 5,973הורדות בחודש
  • 97לייקים

מה זה

המאגר כולל יותר מ־500 אלף זוגות של סרטון מקור, סרטון יעד והוראת עריכה. הנתונים מחולקים לארבע משימות מוגדרות: החלפת אובייקט עם 156.6 אלף דוגמאות, העברת סגנון עם 130.6 אלף, הסרת אובייקט עם 121.6 אלף, והוספת אובייקט עם 115.6 אלף זוגות. המבנה הזה מכסה פעולות עריכה נפוצות שדורשות בדרך כלל התערבות ידנית מורכבת.

תהליך הייצור התבסס על סרטוני גלם שעברו סינון איכות ראשוני ומקטוע אובייקטים. לאחר מכן, מודל Gemini-2.5-Flash-Thinking יצר הנחיות טקסט לעריכה, הוכנו תנאים מקדימים כמו מפות עומק ועריכת פריים ראשון, ומודל VACE ייצר את סרטוני היעד. בסיום, מודל השפה הגדול ביצע סינון איכות נוסף ותיעוד מחדש. החוקרים דיווחו על הערכה אנושית במדגם של 200 סרטונים, שלפיה מעל 90 אחוז מהנתונים בכל משימה עומדים ברף איכות גבוה.

מתאים ל

  • אימון מודלים להסרת אובייקט

    שימוש בזוגות הסרטונים במחיצת remove כדי ללמד מודלים למחוק עצמים מרצף פריימים.

  • עריכת סגנון חזותי בווידאו

    התאמת מודלים לשינוי סגנון אמנותי בווידאו לפי הנחיות טקסט בעזרת נתוני style.

  • החלפת פריטים לפי הוראה

    אימון על משימת replace להחלפת אובייקט קיים באובייקט חדש תוך שמירה על תנועה.

איפה זה נופל

חלק ניכר מהנתונים נוצר באופן סינתטי באמצעות מודלים כמו VACE ו־Gemini, מה שאומר שעיוותים גנרטיביים מובנים בתוך הדאטהסט. כל ההוראות והתיאורים מוגבלים לשפה האנגלית בלבד, כך שאין שום תמיכה בעברית. בדיקת האיכות האנושית נעשתה על מדגם זעיר של 200 סרטונים בלבד מתוך מעל חצי מיליון רשומות, לכן צפו להיתקל בדוגמאות בעייתיות במהלך האימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC-SA 4.0, והיוצרים מציינים במפורש שהדאטהסט מיועד למחקר בלבד. אסור לבנות איתו מודל למכירה או לשלב אותו במערכת מסחרית.

האם הדאטהסט כולל תמיכה בהוראות בעברית?

לא, כל הטקסטים וההנחיות בדאטהסט נכתבו באנגלית בלבד. אם תרצו לאמן מודל שמבין עברית, תצטרכו לתרגם את קובצי הקונפיגורציה או לאסוף דאטה נוסף.

איך נוצרו זוגות הסרטונים במאגר?

החוקרים לקחו סרטוני גלם, חילקו אותם למסיכות אובייקטים וייצרו הנחיות באמצעות Gemini. לאחר מכן הם הפיקו את סרטוני היעד באמצעות מודל VACE וסיננו את התוצאות שוב באמצעות מודל שפה.

איך טוענים

המאגר מחולק לארבע תיקיות לפי משימות: add, remove, replace ו־style. בכל תיקייה יש קובץ קונפיגורציה בפורמט JSON ותיקיות של סרטוני מקור וסרטוני יעד, שנשמרים כסרטוני MP4 או בארכיוני tar. סרטוני המקור והיעד חולקים שמות זהים בשלוש משימות, ובמשימת הסגנון נוסף שם הסגנון לסרטון היעד. אין צורך בבקשת גישה מיוחדת, והמחברים מספקים סקריפטים בגיטהאב לבדיקה וטעינה משולבת של המשימות לפי יחס מותאם.

from datasets import load_dataset

ds = load_dataset("HiDream-ai/ReCo-Data")

הרישיון

הרישיון הוא CC BY-NC-SA 4.0. המשמעות ברורה וחד משמעית: השימוש מותר למטרות מחקר אקדמי בלבד ואסור לחלוטין לכל שימוש מסחרי. בנוסף, חובה לתת קרדיט ליוצרים, ואם אתם משנים את הנתונים או מפיצים אותם, עליכם לשחרר את התוצר תחת אותו רישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗