GPT
Y

YouTube-Commons

קוד פתוח

PleIAscc-by-4.02024-04-15

  • conversational

תמלילי אודיו ממיליוני סרטוני יוטיוב שפורסמו תחת רישיון פתוח. מקור נדיר לטקסט מדובר בהיקף עצום של כמעט 45 מיליארד מילים, שמיועד למי שחייב לדעת בדיוק מאיפה הגיע כל משפט.

  • 6,269הורדות בחודש
  • 394לייקים

מה זה

המאגר מכיל 22,709,724 תמלילים שמגיעים מתוך 3,156,703 סרטונים שונים וכוללים 721,136 ערוצים עצמאיים. הטקסטים מייצגים קרוב ל־45 מיליארד מילים, ומבוססים על תכנים שעלו ליוטיוב במקור ברישיון CC-BY בלבד. כל רשומה כוללת את התמליל עצמו יחד עם נתוני מקור מלאים, שכוללים את כותרת הסרטון, הקישור הישיר אליו, שם הערוץ ותאריך ההעלאה המקורי.

מבחינת שפות, 71% מהתכנים המקוריים הם באנגלית, אך המאגר כולל גם תמלילים בשפות כמו צרפתית, ספרדית, גרמנית ורוסית. לצד התמלילים המקוריים שחולצו מהסרטונים, הקורפוס מכיל תרגומים אוטומטיים עבור כמעט כל הסרטונים לשפות אנגלית, צרפתית, ספרדית, גרמנית, רוסית, איטלקית והולנדית. המטרה היא לספק חלופה לטקסטים כתובים קלאסיים כמו מאמרים אקדמיים, ולאפשר אימון על שפה מדוברת ויומיומית.

מתאים ל

  • אימון מודלי שפה לשיחה

    לימוד מבנה שיחה ודיבור טבעי באמצעות מיליארדי מילים מדוברות מסרטונים חיים.

  • מחקר במדעי הרוח הדיגיטליים

    ניתוח מגמות לשוניות ותרבותיות על פני מאות אלפי ערוצי תוכן מגוונים.

  • אימון מודלי תרגום מכונה

    שימוש בתרגומים האוטומטיים המקבילים לשפות אירופיות עבור טקסט לא פורמלי.

איפה זה נופל

ההטיה הבולטת ביותר היא השפה. אנגלית שולטת ב־71% מתוכן המקור, ושאר המאגר נשען בכבדות על תרגומים אוטומטיים של יוטיוב, שמביאים איתם שגיאות תרגום והזיות מובנות. אין במאגר עברית בכלל. בנוסף, מדובר בתמלילי דיבור של יוטיוב שאינם תמיד מדויקים, חסרי סימני פיסוק מלאים לעיתים, וכוללים עגה אינטרנטית. המפרסמים מדגישים כי המאגר אינו מכסה את כלל סרטוני הרישיון הפתוח בפלטפורמה, ודרישת הייחוס הפרטנית לכל ערוץ יוצרת מורכבות משפטית לא מבוטלת.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

הרישיון הוא cc-by-4.0 ולכן שימוש מסחרי מותר מבחינה חוקית. עם זאת, הרישיון דורש מתן קרדיט מלא לכל ערוץ יוטיוב מקורי. המפרסמים עצמם ממליצים להשתמש במאגר בעיקר למחקר פתוח ומציינים שקיים דיון אתי סביב אימון מודלים על תוכן כזה.

האם יש במאגר תכנים בעברית?

לא. המאגר כולל שפות כמו אנגלית, צרפתית, ספרדית, פורטוגזית, גרמנית ורוסית, לצד תרגומים לאיטלקית והולנדית. עברית אינה נכללת ברשימת השפות של הפרויקט.

איך נאספו התמלילים הללו?

היוצרים אספו סרטונים שהועלו ליוטיוב תחת רישיון פתוח Creative Commons בלבד. מתוך הסרטונים הללו נמשכו התמלילים המקוריים יחד עם התרגומים האוטומטיים שנוצרו בפלטפורמה, לצד כל נתוני הזיהוי של הסרטון והערוץ.

באיזה פורמט המידע מגיע וכמה קבצים יש בו?

המאגר מורכב מ־441 קבצים בסך הכל. הנתונים עצמם שמורים בקובצי Parquet מחולקים, מה שמאפשר קריאה ישירה ויעילה באמצעות ספריות עיבוד נתונים.

איך טוענים

המאגר פתוח להורדה ישירה דרך Hugging Face ללא צורך באישור גישה מוקדם. הנתונים מחולקים למאות קבצי Parquet, החל מ־cctube_0.parquet ומעלה, מתוך סך של 441 קבצים שנמצאים במאגר. בעבודה בפועל מומלץ לטעון את המידע בזרימה או בחלקים, בגלל כמות המילים העצומה. השדות המרכזיים שצריך לשים לב אליהם בכל רשומה הם הטקסט המתומלל, שפת המקור, ושדות המקור שכוללים קישור ושם ערוץ.

from datasets import load_dataset

ds = load_dataset("PleIAs/YouTube-Commons")

הרישיון

המאגר מופץ ברישיון cc-by-4.0. מותר להשתמש בו לצרכים מחקריים ומסחריים, לשנות אותו ולפרסם מחדש, אך חלה חובת ייחוס ברורה ליוצרים המקוריים. המפרסמים מציינים שחובה לתת קרדיט לכל ערוץ יוטיוב שממנו נלקח המידע, וממליצים למי שמאמן מודל לפרסם את מקורות הנתונים המלאים או תיעוד פתוח ומפורט כדי לעמוד בתנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗