GPT
R

Raon-OpenTTS-Pool

קוד פתוח

KRAFTONother2026-03-25

  • text-to-speech
  • tts
  • speech
  • audio
  • open-data

קורפוס ענק של 615 אלף שעות דיבור באנגלית עבור אימון מודלי הקראת טקסט. הוא מאחד עשרה מקורות ציבוריים מובילים תחת פורמט קבצים אחיד וקל לעיבוד.

  • 6,953הורדות בחודש
  • 41לייקים

מה זה

המאגר כולל כ־239.7 מיליון מקטעי דיבור שאורכם המרבי 30 שניות, שנאספו מתוך שמונה מאגרים ציבוריים קיימים ומקטעי וידאו מיוטיוב. יותר ממחצית מהשעות מגיעות מתת-המאגר Raon-YouTube-Commons, שעבר עיבוד הכולל הפרדת מוזיקה ורעשי רקע, חלוקה לדוברים לפי PyAnnote, זיהוי מקטעי קול ותמלול אוטומטי מחדש באמצעות Whisper-large-v3. שאר המאגר מורכב מאוספים מוכרים כמו LibriHeavy, Emilia ו־VoxPopuli ששולבו ללא שינוי תוכן.

הנתונים מחולקים לשני ספליטים עיקריים. ספליט pool שמכיל את כלל הדגימות, וספליט core הכולל כ־510.1 אלף שעות באיכות גבוהה יותר. כדי ליצור את גרסת ה־core, המפתחים דירגו את הדגימות לפי איכות השמע הנתפסת, יחס פעילות הקול ורמת שגיאות התמלול, והסירו את 15 האחוזים שקיבלו את הציונים הנמוכים ביותר.

מתאים ל

  • אימון מודלי הקראה באנגלית

    בניית מודלי TTS גדולים הזקוקים למאות אלפי שעות שמע מגוונות מרובות דוברים וסביבות הקלטה.

  • אימון מודלים מסחריים מותאמים

    שימוש בתת-המאגרים החופשיים בלבד, כמו YouTube-Commons ו־LibriHeavy, לפיתוח מודל שפתוח להפצה מסחרית.

  • מחקר על סינון שמע לדיבור

    השוואת ביצועי מודלים בין ספליט הנתונים המלא לבין ספליט ה־core כדי לבחון שיטות סינון איכות אוטומטיות.

איפה זה נופל

ההגבלה הראשונה היא קצב הדגימה, 16 קילו-הרץ באיכות Opus מכווצת, מה שלא יספיק למי שמחפש לאמן מודל הקראה בחדות אולפנית גבוהה של 24 או 44.1 קילו-הרץ. המאגר מוגבל לאנגלית בלבד, ואין בו שום תמיכה בעברית או במבטאים מקומיים. בנוסף, חלק גדול מהתמלולים מבוסס על מודל Whisper אוטומטי ולא על בקרה אנושית, כך ששגיאות מילים והטיות זיהוי עדיין קיימות ברקע למרות הסינון, במיוחד בחלקים שנלקחו מיוטיוב.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

רק בחלקו. האוספים המרכזיים כמו Raon-YouTube-Commons ו־LibriHeavy מאפשרים שימוש מסחרי, אך Emilia-YODAS2 ו־SPGISpeech2-Cut מוגבלים לשימוש לא מסחרי בלבד. כדי לאמן מודל מסחרי, עליכם להגדיר את הטעינה כך שתדלג על המאגרים האסורים.

האם הדאטהסט כולל שפות נוספות מלבד אנגלית או עברית?

לא. המאגר כולל אך ורק דיבור בשפה האנגלית. אין בו שום תמיכה בעברית או בשפות זרות אחרות.

איך מחלצים את קובצי השמע בפועל?

השמע אינו זמין להאזנה דרך הדפדפן באתר. עליכם להוריד את קובצי ה־tar למחשב או לשרת בעזרת הספרייה huggingface_hub, ולאחר מכן להזרים את דגימות ה־Opus וה־JSON באמצעות ספריית webdataset בפייתון.

מה ההבדל בין ספליט pool לבין ספליט core?

גרסת ה־pool מכילה את כלל 615 אלף השעות שנאספו. גרסת ה־core מכילה כ־85 אחוז מהנתונים, לאחר שהוסרו דגימות עם רעשי רקע כבדים, שתיקות ארוכות או חוסר התאמה בין הטקסט לדיבור לפי מודל Whisper.

איך טוענים

השמע מאוחסן ב־1,821 קובצי ארכיון של WebDataset בפורמט Opus בקצב של 64 קילו-ביט לשנייה ובתדר דגימה של 16 קילו-הרץ, כך שאי אפשר לצפות בשמע ישירות בממשק האתר אלא רק במטא-דאטה. טעינת הנתונים דורשת הורדה של קובצי ה־tar באמצעות snapshot_download ומעבר עליהם בספריית webdataset. כל דגימה כוללת קובץ שמע וקובץ מידע בפורמט JSON עם התמליל, משך ההקלטה ומקור הנתונים. אם רוצים לאמן רק על דגימות ה־core, מורידים את מפתחות הדגימות המתאימים מטבלת המטא-דאטה ומסננים את קובצי הארכיון בזמן אמת.

from datasets import load_dataset

ds = load_dataset("KRAFTON/Raon-OpenTTS-Pool")

הרישיון

המאגר מוגדר תחת רישיון מעורב ומחייב בדיקה של כל תת-מאגר בנפרד. חלק מהאוספים מותרים לשימוש מסחרי תחת CC BY 4.0 או נחלת הכלל, אך תת-המאגר Emilia-YODAS2 מוגבל לשימוש לא מסחרי ברישיון CC BY-NC 4.0, ו־SPGISpeech2-Cut כפוף להסכם השימוש של Kensho. אם אתם בונים מודל למוצר מסחרי, חובה להחריג את שני המאגרים האלה מהאימון.

הרישיון המלא ב־Hugging Face ↗