GPT
D

Ditto-1M

קוד פתוח

QingyanBaicc-by-nc-sa-4.02025-10-18

מאגר וידאו סינתטי לאימון מודלים של עריכת וידאו לפי הוראות טקסט. הוא מציע מעל מיליון שלשות מסודרות של סרטון מקור, הנחיית עריכה וסרטון תוצאה.

  • 5,934הורדות בחודש
  • 52לייקים

מה זה

המאגר מכיל מעל מיליון רשומות הבנויות כשלשות של נתיב לסרטון מקור, הנחיית עריכה טקסטואלית ונתיב לסרטון הערוך. כל סרטון כולל 101 פריימים ברזולוציות של 1280 על 720 או 720 על 1280. הנתונים אינם צילומים מהעולם האמיתי, אלא תוצרים סינתטיים שנוצרו משילוב של עורך תמונות עם מחולל וידאו מבוסס הקשר, ועברו סינון איכות ושיפור להפחתת רעשים.

התוכן מחולק לקטגוריות עריכה ברורות. ישנם סרטוני מקור בנפח של כ־180 גיגה בייט, עריכות סגנון גלובליות הכוללות מראה אמנותי ותיקוני צבע, עריכות חופשיות מורכבות של שינויי סביבה וסצנה, ועריכות מקומיות ממוקדות בשינוי או החלפה של עצמים ספציפיים. בנוסף, המאגר מספק תיאורים לסרטוני המקור שנוצרו באמצעות QwenVL, וקבצי CSV מובנים המותאמים ישירות לעבודה עם DiffSynth-Studio.

מתאים ל

  • אימון מודלי עריכת וידאו

    לימוד מודלים לבצע שינויי סגנון ועריכת סצנה שלמה מתוך פקודות טקסט באנגלית.

  • החלפת עצמים מקומית

    שימוש בתת-המאגר המקומי לאימון מודלים על זיהוי, מחיקה או החלפה של אובייקטים בתוך וידאו.

  • מחקר על דאטה סינתטי

    בדיקת השפעת נתוני וידאו סינתטיים וסגירת הפער מול עולם המציאות.

איפה זה נופל

כל הנתונים במאגר נוצרו בצורה סינתטית ולא צולמו במציאות, כך שאימון עליהם עלול ליצור פער ביצועים כשעוברים לעריכת סרטונים מהעולם האמיתי. הטקסט וההנחיות קיימים באנגלית בלבד ונוצרו על ידי סוכנים אוטומטיים, כך שאין כאן בדיקה של שפות אחרות או ניסוחים אנושיים ספונטניים. בנוסף, אורכי הסרטונים קבועים בדיוק ל־101 פריימים, מה שדורש בדיקה והתאמה אם המודל שלכם מיועד לאורכים משתנים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-sa-4.0, המגדיר במפורש שימוש לא מסחרי בלבד. כל שימוש בנתונים או במודלים שאומנו עליהם מוגבל למחקר אקדמי ולניסויים פנימיים.

כמה שטח אחסון צריך כדי להוריד את הכל?

תיקיית הווידאו המלאה שוקלת כ־2 טרה בייט. אם שטח האחסון שלכם מוגבל, עדיף להוריד רק תתי-מאגרים ספציפיים כמו עריכות מקומיות או שינויי סגנון, שנמצאים בקבצי ארכיון נפרדים.

האם יש במאגר תמיכה בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל הנחיות העריכה והתיאורים נוצרו באנגלית. כדי לאמן מודל שיגיב להנחיות בעברית תצטרכו לתרגם את המטא-דאטה באופן עצמאי.

מאיפה הגיעו הסרטונים?

הסרטונים לא נאספו מהרשת אלא נוצרו באופן סינתטי. היוצרים חיברו עורך תמונות עם מחולל וידאו מבוסס הקשר, ונעזרו ב־QwenVL ובסוכנים חכמים ליצירת התיאורים וההוראות.

איך טוענים

טעינה בסיסית מתבצעת דרך ספריית datasets באמצעות הפקודה load_dataset("QingyanBai/Ditto-1M"), ללא צורך בבקשת גישה מיוחדת. יחד עם זאת, מדובר בהורדה מורכבת הדורשת תשתית אחסון רצינית, שכן נפח הווידאו הכולל מגיע לכשני טרה בייט. הקבצים מחולקים לארכיוני tar מפוצלים לפי תתי-תיקיות, כך שמומלץ להוריד רק את התחום הרלוונטי למשימה שלכם, לחבר את החלקים באמצעות cat ולחלץ ישירות כדי לחסוך מקום בדיסק.

from datasets import load_dataset

ds = load_dataset("QingyanBai/Ditto-1M")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0. המשמעות היא איסור מוחלט על שימוש מסחרי מכל סוג, חובת מתן קרדיט מלא ליוצרים, ודרישה לשתף כל יצירה נגזרת תחת אותו הרישיון בדיוק. מודל שיאומן על הנתונים הללו יהיה מוגבל למחקר בלבד ולא יוכל להשתלב במוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗