GPT
Y

yodas

קוד פתוח

espnetcc-by-3.02024-02-10

המאגר מרכז מעל 369,000 שעות דיבור מיוטיוב ב־149 שפות שונות. מי שפונה אליו מחפש היקף עצום של קטעי קול עם תמלול לאימון מודלי דיבור.

  • 84,829הורדות בחודש
  • 154לייקים

מה זה

הנתונים מורכבים ממקטעי שמע קצרים מתוך סרטוני יוטיוב שסומנו ברישיון חופשי, יחד עם טקסט הכתוביות התואם. כל דגימה מכילה מזהה ייחודי, מזהה מקטע, מערך נתוני שמע בתדר דגימה של 16 קילוהרץ והטקסט שנאמר.

החלוקה הפנימית מפרידה בין כתוביות ידניות לכתוביות שנוצרו אוטומטית. שמות החלקים חושפים את המקור לפיהספרה הראשונה. ספרה 0 מייצגת כתוביות ידניות שהועלו על ידי משתמשים, וספרה 1 מייצגת תמלול אוטומטי. האנגלית תופסת נתח כבד עם מיליוני שעות ומחולקת לעשרות תתי מאגרים, אך יש ייצוג גם לשפות רבות נוספות בנפחים קטנים בהרבה.

מתאים ל

  • אימון זיהוי דיבור באנגלית

    אימון מודלי תמלול על עשרות אלפי שעות שמע עם כתוביות ידניות ואוטומטיות.

  • בדיקת מודלים על עברית

    הערכת ביצועים של מודלי שמע על בסיס 161 שעות דיבור טבעי מיוטיוב.

  • אימון שפות רב לשוני

    שימוש במגוון הרחב של 149 השפות לבניית ייצוגי שמע בסיסיים למודלים רב לשוניים.

איפה זה נופל

איכות התמלול אינה אחידה. הכרטיס מבהיר במפורש שכתוביות ידניות מציינות רק שהן הועלו על ידי משתמשים, ולא בהכרח נכתבו על ידי אדם, כך שגם בהן עלולות להופיע שגיאות זיהוי קשות. בנוסף, חלוקת השעות מוטה בצורה קיצונית. שפות מסוימות מחזיקות אלפי שעות, בעוד שפות רבות קיבלו שברירי שעה בלבד. עבור עברית תחת הקוד הישן מופיעות רק כ־161 שעות של כתוביות ידניות ללא כתוביות אוטומטיות, מה שלא מספיק לבדו לאימון מלא.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

כן, הרישיון המדווח מאפשר שימוש מסחרי כל עוד מקפידים על מתן קרדיט ליוצרים. עם זאת, החוקרים מציינים שסרטונים הוסרו לבקשת בעלי זכויות, ולכן כדאי לוודא שאין סיכון ספציפי בחומרים שאתם מעבדים.

האם יש במאגר נתונים בעברית?

יש במאגר תת קובץ ייעודי לעברית תחת הקוד הישן iw000. הוא מכיל קצת יותר מ־161 שעות של שמע עם כתוביות ידניות. אין עבור עברית קובץ של כתוביות אוטומטיות.

איך נאספו קובצי השמע והטקסט?

החוקרים הורידו סרטונים מיוטיוב שסומנו ברישיון חופשי יחד עם הכתוביות שלהם. לאחר מכן הם חילקו את השמע למקטעים והפרידו בין כתוביות שהועלו ידנית לבין כאלו שנוצרו אוטומטית.

מה ההבדל בין החלקים השונים בכל שפה?

הספרה הראשונה במזהה החלק קובעת את מקור הטקסט. ספרה 0 מסמנת כתוביות שהמשתמש העלה לסרטון, בעוד שספרה 1 מסמנת כתוביות שנוצרו על ידי מנגנון התמלול האוטומטי של יוטיוב.

איך טוענים

אין צורך לבקש אישור גישה, הקבצים פתוחים להורדה ישירה דרך הספרייה של הגינג פייס. בגלל המשקל החריג של הנתונים, שבו כל מקטע יכול לשקול עד 500 גיגה בייט, עבודה רגילה של הורדה לדיסק המקומי תיקח זמן ארוך מאוד. מומלץ לטעון את הנתונים במצב הזרמה ישירה באמצעות הפרמטר המתאים, ולבחור תת מאגר ספציפי כמו שפת יעד מסוימת במקום את המאגר כולו. השדות הקריטיים לעיבוד הם מערך השמע והטקסט.

from datasets import load_dataset

ds = load_dataset("espnet/yodas")

הרישיון

המאגר מופץ תחת רישיון ייחוס 3.0 של קריאייטיב קומונס. מותר להשתמש בנתונים למטרות מחקריות ומסחריות, כולל אימון מודלים, בתנאי שנותנים קרדיט מלא ליוצרים לפי ההנחיות. אין חובה לשתף את המודלים או את התוצרים באותו הרישיון.

הרישיון המלא ב־Hugging Face ↗