GPT
Y

yodas-granary

קוד פתוח

espnetcc-by-3.02025-06-09

מאגר ענק של הקלטות דיבור מתויגות עבור זיהוי ותרגום קולי ב־23 שפות אירופיות. הבחירה בו מתאימה למי שצריך היקפי אימון אדירים ומסתמך על תמלול ותרגום שנוצרו על ידי מודלים.

  • 67,198הורדות בחודש
  • 32לייקים

מה זה

המאגר מכיל עשרות מיליוני רשומות שמע שנגזרו ממאגר yodas2, ומהווה תת קבוצה מסוננת של פרויקט Granary של אנבידיה. כל רשומה כוללת קובץ שמע שנדגם ב־16 קילוהרץ, משך זמן בשניות, קוד שפה, סוג המשימה, מזהי מקור של מקטע האודיו, ותמלול טקסטואלי.

התיוג הטקסטואלי אינו ידני. התמלולים הופקו אוטומטית באמצעות מודל faster-whisper-large-v3, עברו תיקוני פיסוק ואותיות רישיות באמצעות Qwen2.5-7B-Instruct, וסוננו בקרת איכות. חלק מהדאטה כולל תרגום לאנגלית שהופק באמצעות EuroLLM-9B-Instruct, כאשר רשומות אלו מסווגות כמשימת תרגום, בעוד השאר נשארות כמשימת זיהוי דיבור בלבד.

החלוקה הפנימית מפרידה בין שפות לבין שתי קטגוריות מרכזיות: מקטעים שכוללים תרגום לאנגלית, ומקטעי תמלול בלבד. אנגלית קיימת בתור שפת מקור לתמלול בלבד ללא תרגום, ורובו המוחלט של נפח המאגר מרוכז בשפות הגדולות כמו אנגלית, ספרדית, גרמנית, רוסית וצרפתית.

מתאים ל

  • אימון מודלי ASR רב-לשוניים

    אימון מודלים לזיהוי דיבור על עשרות מיליוני שעות קול בשפות אירופיות מרכזיות.

  • תרגום קולי אוטומטי

    פיתוח ותרגום ישיר של קול מ־22 שפות אירופיות לאנגלית על בסיס זוגות האודיו והטקסט.

  • אימון מוקדם מבוסס הזרמה

    ביצוע pre-training למודלי אודיו גדולים באמצעות צריכת נתונים בהזרמה ישירה מרחוק.

איפה זה נופל

זהו מאגר עם תיוג סינתטי לחלוטין. כל אות ומילה נשענות על ניחוש של מודלי שפה, ולכן שגיאות של whisper או הזיות של מודלי התרגום חודרות פנימה גם אחרי סינון. מודל שיאומן פה ילמד גם את ההטיות והטעויות של המודלים המקוריים.

פערי הגדלים בין השפות קיצוניים. בעוד באנגלית יש מעל 40 מיליון דגימות, בשפות כמו לטבית יש רק 347 דוגמאות ובקרואטית כ־5,600. עברית לא קיימת כאן כלל. לא הייתי בונה על הנתונים האלה בתור סט בדיקה להערכת מודלים, כי מדידת ביצועים על בסיס תמלול מכונה מעוותת את התוצאות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן. רישיון cc-by-3.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים שיוטמעו במוצרים סגורים. הדרישה היחידה היא מתן קרדיט וייחוס הולם למפרסמי המאגר.

האם המאגר כולל עברית?

לא. המאגר מתמקד ב־23 שפות אירופיות בלבד, ועברית אינה חלק מהרשימה. מפתחים שמחפשים דאטה בעברית יצטרכו לפנות למקורות אחרים.

כמה שטח אחסון צריך בשביל להוריד אותו?

המאגר כולו דורש עשרות טרה בייטים, כאשר תת המאגר באנגלית לבדו שוקל 11.3 טרה בייט וספרדית שוקלת 3 טרה בייט. מומלץ להוריד רק את השפה הרלוונטית או לעבוד בהזרמה בלי לשמור את הקבצים מקומית.

איך נוצרו התמלולים והתרגומים בדאטהסט?

הטקסט אינו תמלול אנושי. השמע תומלל באמצעות faster-whisper-large-v3, שופץ עם Qwen2.5-7B לסימני פיסוק, והתרגומים לאנגלית הופקו באמצעות EuroLLM-9B ולאחר מכן סוננו לאיכות.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות הנתיב espnet/yodas-granary. אין צורך לבקש אישור גישה מיוחד, אבל חובה לקחת בחשבון את הנפח הפיזי. המאגר כולו שוקל עשרות טרה בייטים, כשרק החלק האנגלי לבדו תופס 11.3 טרה בייט בקובצי parquet.

אל תנסו להוריד את הכל למחשב מקומי. הדרך היחידה לעבוד איתו בצורה שפויה היא לטעון שפה בודדת לפי שם, או להפעיל מצב הזרמה streaming=True כדי לעבד את הדגימות ישירות מהרשת.

from datasets import load_dataset

ds = load_dataset("espnet/yodas-granary")

הרישיון

המאגר מופץ ברישיון cc-by-3.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולהפיץ נגזרות שלו, כל עוד נותנים קרדיט מתאים ליוצרים המקוריים. אין דרישה לשתף את המודל המאומן או את הפיתוחים באותו רישיון.

הרישיון המלא ב־Hugging Face ↗