GPT
M

mosel

קוד פתוח

FBK-MTcc-by-4.02024-09-23

  • speech
  • speech-to-text
  • open-source
  • whisper
  • text

המאגר מרכז תמלולים אוטומטיים של מאות אלפי שעות דיבור בשפות אירופיות. הוא שימושי למי שמאמן מודלי שמע וזקוק לטקסט מתויג ברמת פסאודו ליבל על גבי קבצי שמע פתוחים קיימים.

  • 3,453הורדות בחודש
  • 93לייקים

מה זה

המאגר כולל קובצי טקסט בלבד ולא קבצי אודיו בפועל. מדובר בתמלולים שנוצרו באמצעות המודל Whisper large v3 על גבי הקלטות מתוך מאגרי דיבור חופשיים, בעיקר VoxPopuli וליברילייט, ובהמשך נוספו גם נתונים מיוטיוב קומונס. קטעים שהיו ארוכים מסף שלושים השניות של וויספר נחתכו מראש.

המבנה מאורגן בתיקיות לפי קוד שפה בן שתי אותיות. בתוך כל תיקייה יש קובצי tsv שמכילים מזהה מקטע, שפה, תוכן התמלול, ודגלים בוליאניים לזיהוי הזיות של מודל התמלול. הדגלים האלה מסמנים חזרות חריגות על מילים או ביטויים, מילים בודדות שחוזרות על עצמן לאורך כל הטקסט, ומילים ארוכות במיוחד של מעל ארבעים תווים.

מתאים ל

  • אימון מודלי ASR

    שימוש בתמלולים כפסאודו לייבלים לאימון מודלים לזיהוי דיבור בשפות אירופיות על בסיס האודיו המקורי.

  • סינון ואיסוף מידע לתמלול

    מחקר על דפוסי שגיאות והזיות של וויספר באמצעות השדות שמסמנים חזרות ומילים חריגות.

  • אימון מודלי תרגום משמע

    ניצול תרגומי האנגלית שנוספו לנתוני ווקספופולי כדי לאמן מודלים שמתרגמים דיבור ישירות לטקסט באנגלית.

איפה זה נופל

הטקסטים הם תמלול מכונה ולא נבדקו ידנית על ידי בני אדם. למרות שהחוקרים סיפקו אינדיקטורים לחלק מההזיות של וויספר, אין ערובה שהתמלול תואם במדויק לנאמר, ושגיאות שמיעה של המודל נכנסו פנימה. בנוסף, חלוקת השעות אינה שוויונית בעליל. אנגלית תופסת את הנתח המרכזי עם מעל 184 אלף שעות בתמלולים שכאן, בעוד שפות אחרות מקבלות אלפים בודדים, ועברית כלל לא קיימת במאגר.

שאלות
נפוצות

האם המאגר כולל קובצי שמע להורדה?

לא. המאגר מכיל רק קובצי tsv עם תמלולים ומזהים. כדי לאמן מודל שמע תצטרכו להוריד את קובצי הקול ישירות מהפרויקטים המקוריים, כמו VoxPopuli, ולחבר ביניהם.

האם יש במאגר נתונים בעברית?

לא. המאגר ממוקד בשפות הרשמיות של האיחוד האירופי בלבד, ועברית אינה נכללת בו כלל.

מותר להשתמש בתמלולים האלה לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא. התנאי המרכזי הוא מתן קרדיט מתאים ליוצרים כפי שמוגדר ברישיון.

עד כמה התמלולים אמינים בהשוואה לדאטהסטים מתויגים?

התמלולים נוצרו כולם אוטומטית על ידי Whisper large v3 ולא עברו עריכה אנושית. יש בהם שגיאות והזיות מובנות, אם כי המאגר כולל עמודות ייעודיות לסינון חלק מההזיות הנפוצות.

איך טוענים

טוענים את הנתונים ישירות מקובצי ה־tsv שנמצאים במאגר הציבורי, בלי צורך באישור גישה מיוחד. כדי להשתמש בזה לאימון תצטרכו להוריד בנפרד את קובצי האודיו מהמקורות המקוריים כמו VoxPopuli, ולהתאים ביניהם לפי מזהה המקטע id. לפני שמזינים את הטקסט למודל, חובה לסנן את השורות שבהן שדות ההזיות מסומנים כחיוביים.

from datasets import load_dataset

ds = load_dataset("FBK-MT/mosel")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו דורש שיתוף תחת אותו רישיון. החובה היחידה היא מתן קרדיט מתאים ליוצרים ולמקורות.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗