GPT
C

covost2

קוד פתוח

facebookcc-by-nc-4.02022-03-02

מאגר נרחב לתרגום דיבור ישיר לטקסט, הכולל 2,900 שעות הקלטה ממיזם Common Voice. הוא מציע תרגומים מ־21 שפות לאנגלית ומאנגלית ל־15 שפות שונות.

  • 501הורדות בחודש
  • 51לייקים

מה זה

הרשומות מבוססות על הקלטות קול פתוחות של אנשים שתרמו את קולם לפרויקט Common Voice של מוזילה. כל רשומה כוללת קובץ אודיו בפורמט MP3, את התמלול המקורי שלו בשפת המקור, ותרגום טקסטואלי לשפת היעד. הדאטהסט לא מפרט תהליכי סינון מיוחדים בכרטיס, אך הוא מחייב לא לנסות לזהות את הדוברים שתרמו את ההקלטות.

החלוקה הפנימית מוגדרת לפי צמדי שפות, עם פיצול לאימון, ולידציה ובדיקה. בצד שמתרגם מאנגלית לשפות אחרות יש היקף קבוע של 289,430 דגימות אימון ו־15,531 לבדיקה עבור כל יעד, כמו גרמנית, ערבית או יפנית. בכיוון ההפוך, שבו מתרגמים שפות שונות לאנגלית, גודל הדאטה משתנה מאוד, החל מ־207,374 דוגמאות בצרפתית ועד לכ־1,119 דוגמאות בלבד ביפנית.

מתאים ל

  • תרגום דיבור ישיר לטקסט

    אימון מודלים להמרת אודיו משפות שונות ישירות לטקסט באנגלית ללא תמלול ביניים.

  • בנצ'מרק והערכת מודלים

    בדיקת ביצועי תרגום דיבור באמצעות מדד BLEU על גבי סטים מוגדרים מראש.

  • מחקר על שפות מעוטרות משאבים

    בחינת יכולות למידה והעברה בצמדי שפות עם מעט מאוד נתוני אימון, כמו יפנית או אסטונית.

איפה זה נופל

הפערים בין השפות קיצוניים. בעוד ששפות כמו צרפתית, גרמנית או ספרדית נהנות מעשרות ומאות אלפי דוגמאות תרגום לאנגלית, שפות כמו טמילית, אינדונזית או וולשית מכילות רק מעט יותר מאלף דגימות אימון. הכרטיס אינו מספק מידע על הטיות, גיל הדוברים, איכות ההקלטות או המתרגמים, כך שאין שום שקיפות לגבי דיוק התרגום עצמו. בנוסף, עברית כלל לא קיימת במאגר, לא כמקור ולא כיעד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC 4.0, מה שמונע מפורשות כל פעילות מסחרית. זה מתאים רק למחקר אקדמי, בדיקות היתכנות ואימון מודלים שלא מייצרים הכנסה.

האם יש בדאטהסט תמיכה בעברית?

לא, עברית אינה נכללת במאגר כלל. הוא כולל שפות כמו ערבית, פרסית, גרמנית ואחרות, אך עבור עברית תצטרכו לחפש מקורות נתונים אחרים.

מאיפה הגיעו ההקלטות ומי תרגם אותן?

ההקלטות נלקחו ממאגר Common Voice של מוזילה, המבוסס על מתנדבים מרחבי הרשת. הכרטיס הנוכחי לא מפרט מיהם המתרגמים שביצעו את מלאכת התרגום או באיזה תהליך בדיקה הם עברו.

למה הטעינה של קובצי האודיו עלולה להיות איטית?

עמודת האודיו מפענחת את קובצי ה־MP3 ומבצעת דגימה מחדש ל־48,000 הרץ בזמן אמת. אם מנסים לגשת לכל העמודה ברצף במקום לדגום שורה בודדת, המחשב ייתקע על עיבוד האותות.

איך טוענים

הטעינה נעשית בקוד מול צמד שפות ספציפי, למשל אנגלית לגרמנית. כל דגימה מחזירה נתיב לקובץ, מזהה ייחודי, תמלול מקור, תרגום יעד, ומערך אודיו שמפוענח אוטומטית לקצב דגימה של 48,000 הרץ. חשוב לגשת לאודיו לפי אינדקס של שורה בודדת ולא לטעון את כל עמודת השמע בבת אחת, כי פענוח ודגימה מחדש של כמות גדולה גוזלים זמן רב ומשאבי זיכרון כבדים. אין צורך באישור גישה ידני.

from datasets import load_dataset

ds = load_dataset("facebook/covost2")

הרישיון

הרישיון הוא CC BY-NC 4.0. המשמעות ברורה וחד משמעית, מותר להשתמש בנתונים למחקר, הערכה וניסויים פנימיים בלבד, אך חל איסור מוחלט על שימוש מסחרי. אסור למכור את הדאטהסט, אסור לבנות בעזרתו שירות בתשלום, ומודל שאומן עליו ישירות חשוף למגבלת השימוש המסחרי של הרישיון המקורי. חובה גם לתת ייחוס הולם ליוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗