GPT
I

Iwara_MMD_all

קוד פתוח

AnimeFansother2025-07-13

  • not-for-all-audiences

מאגר וידאו עצום שנאסף מאתר Iwara ומתמקד באנימציות MMD. הוא מיועד למי שצריך כמויות אדירות של תוכן אנימציה ודמויות תלת ממדיות למחקר בראייה ממוחשבת.

  • 4,130הורדות בחודש
  • 71לייקים

מה זה

המאגר כולל את כל סרטוני הווידאו הציבוריים שעלו לאתר Iwara.tv מיום הקמתו ועד 15 ביוני 2025. האתר הוא קהילה לשיתוף סרטוני MikuMikuDance, ולכן הרוב המוחלט של התוכן מורכב מאנימציות תלת ממדיות בסגנון אנימה. אין כאן מנגנון סינון מדווח, אלא שאיבה מלאה של כלל הווידאו שהיה זמין באתר.

המבנה הפנימי מאורגן לפי היררכיה של שנה וחודש, כמו תיקיות של שנה ואז שנה מקף חודש. בתוך התיקיות האלה הקבצים מחולקים לארכיוני tar ולחלקים נפרדים. קובצי המטא-דאטה, שכוללים כותרות, שמות יוצרים ותגיות, לא נמצאים כאן בכלל והופרדו למאגר חיצוני אחר לגמרי.

מתאים ל

  • אימון ראייה ממוחשבת באנימציה

    ניתוח תנועות גוף ומעקב אחר שלד של דמויות תלת ממדיות בסגנון אנימה.

  • מחקר אלגוריתמי המלצה

    בדיקת מודלים של סיווג והמלצת וידאו כשמצליבים את הקבצים עם נתוני המטא-דאטה החיצוניים.

  • זיהוי וסיווג תוכן בוגר

    אימון מודלים לזיהוי תוכן מיני ואנימציה בדרגת R-18 בסרטוני וידאו.

איפה זה נופל

התוכן כולל חומרים למבוגרים וסרטוני עירום בדרגות שונות, כך שהוא לא מתאים לסביבות עבודה רגילות או למוצרים מסחריים שדורשים סינון. מעבר לזה, המאגר מוגבל לחלוטין לסגנון חזותי יחיד של מודלי MMD ואנימה, ללא ייצוג של העולם האמיתי. חוסר המטא-דאטה בתוך המאגר עצמו דורש סנכרון עם מאגר חיצוני כדי להבין בכלל מה מופיע בכל קובץ.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

ממש לא. כל הזכויות שייכות ליוצרי הווידאו המקוריים מהאתר, והרישיון לא מתיר שימוש מסחרי. שימוש בנתונים האלה בתוך מודל מסחרי חושף אתכם ישירות לבעיות זכויות יוצרים מול בעלי התוכן.

כמה המאגר שוקל בפועל?

הנפח הכולל של הקבצים חוצה את רף ה־30 טרה בייט. מדובר ביותר מ־3,600 קבצים וארכיונים כבדים. אי אפשר להוריד אותו במלואו בדיסק קשיח רגיל, ותצטרכו תשתית אחסון ייעודית ועבודה לפי חודשים בודדים.

האם יש במאגר עברית?

אין במאגר עברית בכלל. מדובר בווידאו נטו, ללא כתוביות מובנות, והאתר שממנו הגיעו החומרים פועל בעיקר ביפנית, אנגלית וסינית. אפילו נתוני המטא-דאטה שנמצאים במאגר הנפרד אינם כוללים עברית.

איפה נמצאים הטקסטים והתגיות של הסרטונים?

הם לא נמצאים במאגר הזה. מי שהעלה את הנתונים הפריד את כל המטא-דאטה, כמו כותרות ותגיות, למאגר נפרד בקישור חיצוני. תצטרכו להוריד אותו בנפרד ולמפות את המידע לקובצי הווידאו.

איך טוענים

אין צורך באישור גישה מיוחד כדי להתחיל, אבל יש כאן מעל 30 טרה בייט של נתונים שמחולקים לאלפי קבצים. אם תנסו למשוך את הכל במכה אחת ברשת ביתית, סביר להניח שספק האינטרנט שלכם יחסום אתכם. העבודה הנכונה היא להשתמש ב־huggingface-cli ולהוריד תיקיות ספציפיות לפי שנים וחודשים מוגדרים. הווידאו מגיע בארכיוני tar, וכדי לקבל שמות, תגיות והקשר, תצטרכו לחבר אותו ידנית למאגר המטא-דאטה החיצוני.

from datasets import load_dataset

ds = load_dataset("AnimeFans/Iwara_MMD_all")

הרישיון

הרישיון מוגדר כאחר. זכויות היוצרים על הסרטונים שייכות ליוצרים המקוריים מ־Iwara.tv, והיוצרים לא ויתרו עליהן. אסור להשתמש בזה לשום מוצר מסחרי, ואימון מודל עלול לחשוף אתכם לתביעות על הפרת זכויות יוצרים של אלפי יוצרים שונים. המפרסם עצמו מתנער מראש מכל אחריות משפטית שנובעת מהשימוש בחומרים.

הרישיון המלא ב־Hugging Face ↗