GPT
Y

yodas2

קוד פתוח

espnetcc-by-3.02024-04-06

המאגר מרכז אודיו רציף מסרטוני יוטיוב באיכות גבוהה של עשרים וארבעה קילוהרץ עם תמלולים לפי זמנים. הוא נבנה למי שצריך להבין דיבור בהקשר ארוך ומציאותי ולא מקטעים חתוכים ומסוננת מראש.

  • 36,152הורדות בחודש
  • 56לייקים

מה זה

כל רשומה מייצגת סרטון מלא מיוטיוב, שכולל מזהה ייחודי, משך כולל בשניות וקובץ אודיו רציף שלא נחתך מראש. בתוך כל סרטון יש רשימה של מקטעי דיבור עם זמני התחלה וסיום מדויקים והטקסט המתומלל שלהם, כך שאפשר לגשת לתוכן גם ברמת המקטע וגם ברמת היצירה השלמה.

המקור מבוסס על סרטונים שנאספו מיוטיוב תחת רישיונות שימוש חופשיים, תוך שמירה על איכות דגימה של עשרים וארבעה קילוהרץ. הקבצים עצמם מחולקים במאגר לתיקיות לפי קבוצות שונות, כאשר כל קבוצה כוללת ארכיוני אודיו דחוסים, קובצי משכי זמן וטקסטים במבנה ג'ייסון.

מתאים ל

  • זיהוי דיבור בהקשר ארוך

    אימון מודלים לתמלול שיחות והרצאות מלאות ללא צורך בחיתוך מוקדם של האודיו למשפטים בודדים.

  • מודלי שפה קוליים

    בניית מודלים מבוססי אודיו שדורשים קצב דגימה גבוה של עשרים וארבעה קילוהרץ לשמירה על איכות הצליל.

  • יישור טקסט ואודיו

    כיול מערכות התאמת זמנים בין תמלול כתוב לקול באמצעות זמני ההתחלה והסיום שמצורפים לכל מקטע.

איפה זה נופל

הכרטיס לא מפרט אילו שפות קיימות בפועל מתוך שמות הקבוצות, ולכן צריך לבדוק ידנית אם יש ייצוג לשפה שלכם. בנוסף, מדובר באודיו שנלקח מיוטיוב ללא פירוט על שיטת יצירת התמלולים או רמת הדיוק שלהם, מה שעלול להכניס רעשי רקע ותמלולים לא מדויקים. היוצרים גם מאפשרים לבעלי זכויות לבקש הסרה במייל, כך שרשומות מסוימות עלולות להימחק בעתיד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון המדווח הוא CC-BY 3.0, ולפי תנאיו שימוש מסחרי מותר לחלוטין כל עוד מקפידים לתת קרדיט ליוצרים. עם זאת, החומר נאסף מיוטיוב, והיוצרים מחזיקים כתובת מייל ייעודית שמאפשרת לבעלי זכויות לדרוש מחיקת סרטונים, כך שצריך לקחת זאת בחשבון.

האם יש במאגר הקלטות בעברית?

התיעוד שפורסם אינו כולל פירוט מסודר של השפות הזמינות במאגר. שמות התיקיות מופיעים כקידודים טכניים כמו aa000 או en000, ולכן לא ניתן לדעת אם עברית נכללת בלי לבדוק ישירות את תוכן הקבצים.

מה ההבדל בין גרסה זו לגרסת YODAS הקודמת?

הגרסה הזו מספקת את הסרטונים המלאים ברצף אחד ללא חיתוך מוקדם של קובצי הקול, לעומת הגרסה הראשונה שחילקה אותם למקטעים. בנוסף, קצב הדגימה של האודיו הועלה לשיעור של עשרים וארבעה קילוהרץ במקום שישה עשר קילוהרץ.

איך אפשר לעבוד עם המאגר בלי להוריד את כל הנפח שלו?

המאגר כולל עשרות אלפי קבצים והורדה מלאה תיקח זמן רב. אפשר לטעון אותו בעזרת הספרייה עם הגדרת הזרמה פעילה, וכך לעבד את הנתונים תוך כדי תנועה או להוריד רק תת מאגר ספציפי לבדיקה מקומית.

איך טוענים

טוענים את המאגר ישירות בעזרת הספרייה הפופולרית דרך השם espnet/yodas2 עם ציון תת המאגר המבוקש. אין צורך באישור גישה מקדים, והנתונים פתוחים לחלוטין להורדה. מאחר שמדובר בכמעט מאה אלף קבצים שמחולקים לארכיוני אודיו כבדים, עדיף להפעיל מצב הזרמה כדי לבדוק את המבנה. השדות החשובים לשימוש הם מערך האודיו עצמו ורשימת המקטעים שכוללת את התמלול וזמני ההתחלה והסיום.

from datasets import load_dataset

ds = load_dataset("espnet/yodas2")

הרישיון

המאגר מופץ תחת רישיון פתוח מסוג CC-BY 3.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, לערוך ולבנות עליו מודלים, בתנאי שנותנים ייחוס מתאים ליוצרים. אין חובת שיתוף זהה שמאלצת לשחרר את התוצרים באותו הרישיון, אך יש לזכור שהתוכן נאסף מסרטוני יוטיוב ומבוסס על הרישיונות המקוריים שלהם.

הרישיון המלא ב־Hugging Face ↗