GPT
F

floras

קוד פתוח

espnetcc-by-3.02024-10-24

מאגר שמביא 32,000 שעות של שיחות ארוכות מיוטיוב ב־50 שפות. הוא נועד למי שרוצה לבחון זיהוי דיבור, תרגום וסיכום על אודיו חי ומחוספס ולא על הקראת ספרים נקייה באולפן.

  • 6,492הורדות בחודש
  • 15לייקים

מה זה

המאגר כולל כ־32,000 שעות של קטעי אודיו ארוכים עם דובר אחד או יותר, שנלקחו מפרויקט YODAS המבוסס על סרטוני יוטיוב והכתוביות שלהם. כדי להתמודד עם הרעש המקורי, החוקרים סיננו את רוב החומר באמצעות ציוני יישור של CTC. התרגומים לאנגלית והסיכומים נוצרו אוטומטית באמצעות Gemini Flash, כך שלא כל דוגמה מכילה את כל סוגי המידע במקביל.

המבנה מחולק לשני חלקים עיקריים. החלק הראשון הוא monolingual וכולל אנגלית בלבד עם חלוקה לאימון, פיתוח ומבחן, כאשר שדה התרגום בו נשאר תמיד ריק. החלק השני הוא multilingual ומכסה 49 שפות נוספות. בחלק הרב-לשוני קיימים שני סטים שונים של מבחן, אחד שעבר בדיקה ותיקון בידי מתרגמים אנושיים והשני כולל תוויות אוטומטיות שלא עברו סינון אנושי.

מתאים ל

  • הערכת תמלול שיחות ארוכות

    בדיקת ביצועי מודלי ASR על שיחות מרובות דוברים עם רעשי רקע ישירות מיוטיוב.

  • אימון תרגום דיבור לאנגלית

    בניית מודלי דיבור לתרגום טקסט מ־49 שפות לאנגלית על בסיס אודיו לא ערוך.

  • סיכום דיבור רב-לשוני

    הערכת מודלים שמפיקים תקציר טקסטואלי ישירות מתוך הקלטת שמע ארוכה ללא תמלול מוקדם.

איפה זה נופל

אם אתם בונים על עברית, היא פשוט לא קיימת כאן. מעבר לזה, התרגומים והסיכומים בסט האימון ובסט הפיתוח נוצרו במודל שפה של גוגל ומעולם לא נבדקו בידי אדם, מה שמכניס הזיות מובנות לתוך הדאטה. גם בסט המבחן רק שלוש שפות עברו אימות אנושי, אנגלית, יפנית ומנדרינית. שאר השפות נשענות לחלוטין על תוויות מכונה ועלולות לכלול כתוביות יוטיוב משובשות שפוגעות באיכות התוצאה.

שאלות
נפוצות

האם יש בדאטהסט עברית?

לא, עברית לא נכללת ברשימת 50 השפות של המאגר. הוא מכיל שפות מערב ומזרח אירופה, מרכז ומזרח אסיה, וכן ערבית ופרסית, אך עברית נותרה בחוץ.

האם מותר להשתמש בו לפרויקט מסחרי?

הרישיון הוא cc-by-3.0 והוא מתיר שימוש מסחרי, בתנאי שאתם מעניקים קרדיט מפורש למפרסמי המאגר. יחד עם זאת, מקור ההקלטות הוא סרטוני יוטיוב, ולכן כדאי לבדוק את ההשלכות המשפטיות של אימון על תוכן גולשים לפני שמשלבים אותו במוצר.

מה מייחד אותו מול מאגרים כמו FLEURS או LibriSpeech?

מאגרים ותיקים מתמקדים בדרך כלל בהקראת ספרים על ידי דובר בודד ובסביבה שקטה יחסית. כאן מדובר בשיחות חיות וארוכות עם דובר אחד או יותר, ברמת רעש טבעית של סרטוני רשת, יחד עם משימות משולבות של תרגום וסיכום.

איך נוצרו התקצירים והתרגומים?

הם חולצו באופן אוטומטי מתוך הכתוביות והאודיו בעזרת Gemini Flash של גוגל. רק בסט הבדיקה של אנגלית, יפנית ומנדרינית נעשה סינון ותיקון ידני, בעוד שאר המידע מבוסס כולו על תוויות מכונה שלא בוקרו.

איך טוענים

החומר יושב בפורמט Parquet בחלוקה לאלפי קבצים, 7,138 קבצים בסך הכל, ונגיש להורדה ישירה ללא צורך בהרשאה מוקדמת. כל רשומה כוללת מזהה, קוד שפה, מדד התאמה של CTC, קובץ אודיו עם קצב דגימה, תעתיק טקסטואלי, ובמידה שקיימים גם תרגום לאנגלית וסיכום. כדאי לסנן מראש דוגמאות לפי שדה הציון של ה־CTC כדי לוודא התאמה טובה בין הקול לטקסט.

from datasets import load_dataset

ds = load_dataset("espnet/floras")

הרישיון

הרישיון המדווח הוא cc-by-3.0. מותר להשתמש בחומר לצרכים מחקריים ומסחריים, כולל שינוי והפצה, כל עוד נותנים ייחוס הולם ליוצרים המקוריים. אין דרישה לשתף תוצרים או מודלים תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗