GPT
L

libriheavy

קוד פתוח

mythicinfinityapache-2.02024-07-11

מאגר שמספק מעל 50,000 שעות דיבור מתויגות באנגלית עבור זיהוי ויצירת דיבור. הוא משדרג הקלטות קיימות לקבצי איכותיים יותר עם פיסוק, אותיות גדולות והקשר טקסטואלי מלא.

  • 5,818הורדות בחודש
  • 17לייקים

מה זה

המאגר הזה הוא גרסה מתויגת ומורחבת של Libri-Light, שמבוססת במקורה על הקראת ספרי שמע מתוך LibriVox. היוצרים לקחו את האודיו המקורי, שדרגו אותו ברוב המקרים מקבצי mp3 של 64kbps לקבצים באיכות 128kbps, ודחסו הכל מחדש בקידוד Opus בקצב של 68kbps כדי לשמור על איכות שמע סבירה במשקל נמוך יותר. הרשומות עצמן מכילות מקטעי דיבור עם תמלול שכולל אותיות גדולות וסימני פיסוק מלאים.

הנתונים מחולקים למספר תצורות שונות שכוללות רק פיצול אימון בשם train. יש כאן חלוקה לגדלים: small כולל 509 שעות מ־417 דוברים, medium מציע 5,042 שעות מ־1,531 דוברים, ו־large מגיע להיקף של 50,794 שעות מ־6,736 דוברים. לצד אלה קיימים סטים לבדיקה ופיתוח: dev של 22.3 שעות, וכן סטים של test_clean ו־test_other בגרסאות רגילות של כ־10 עד 11 שעות או מורחבות של מעל 100 שעות.

מתאים ל

  • אימון זיהוי דיבור נרחב

    מתאים לבניית מודלי ASR באנגלית שדורשים עשרות אלפי שעות ותיוג הכולל פיסוק ושימוש נכון באותיות רישיות.

  • אימון מודלי הקראת טקסט

    שימושי למערכות TTS בזכות איכות אודיו משודרגת ומאות שעות של דיבור קריא ונקי מדוברים שונים.

  • הערכת ביצועי תמלול

    בדיקת מודלים קיימים על סטי הבדיקה הנקיים או המאתגרים כדי למדוד דיוק בהבנת טקסט עם הקשר מלא.

איפה זה נופל

ההקלטות כולן באנגלית בלבד ומבוססות על מתנדבים שמקריאים ספרי שמע מהנחלת הכלל, כך שאין כאן עברית והשפה נוטה להיות ספרותית, מיושנת ולעיתים דרמטית. המאגר לא משקף שיחות ספונטניות, פגישות עבודה או דיאלוגים מהחיים האמיתיים עם הפרעות ורעשי רקע מודרניים. בנוסף, חלוקת הדוברים לא אחידה: בתצורה הגדולה הממוצע עומד על מעל 7 שעות לאדם, בעוד שבסטים של הבדיקה מדובר בדקות בודדות לכל דובר. לפני שמשלבים מודל כזה במוצר, חייבים לבדוק איך הוא מתמודד עם אנגלית יומיומית, סלנג ומבטאים מגוונים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא apache-2.0 ומאפשר שימוש מסחרי חופשי לחלוטין. מותר לכם לאמן עליו מודלים ולהפיץ מוצרים מבוססים עליהם. הדרישה העיקרית היא שמירה על תנאי הרישיון ומתן ייחוס למחברים המקוריים.

האם יש בדאטהסט תמיכה בעברית?

לא, המאגר מוגדר ומכיל אך ורק הקלטות ותמלולים בשפה האנגלית. המקור הוא ספרי שמע מאתר LibriVox שכולם מוקראים באנגלית. לצורך אימון מודלים בעברית תצטרכו לחפש מקורות נתונים אחרים.

במה הדאטהסט הזה שונה מ־Libri-Light או LibriSpeech?

הוא מבוסס על Libri-Light אך משדרג את איכות קבצי האודיו למקור של 128kbps שנדחס ב־Opus 68kbps במקום קבצים באיכות נמוכה יותר. בנוסף, הוא מספק תמלול מתוקן שכולל אותיות גדולות, סימני פיסוק והקשר טקסטואלי, בניגוד לתמלול הגולמי המקובל.

איך מומלץ לטעון את הנתונים בלי למלא את הדיסק?

עדיף להימנע מטעינה של כל המאגר בבת אחת כי הוא מכיל מעל 50,000 שעות ומחולק לאלפי קבצי Parquet. ההמלצה היא לטעון קונפיגורציה בודדת כמו small או medium בעזרת הספרייה datasets. מיקוד בתצורה ספציפית יוריד למחשב שלכם רק את הקבצים שהוגדרו עבורה.

איך טוענים

אתם טוענים אותו דרך datasets באמצעות הפקודה load_dataset עם מזהה המאגר mythicinfinity/libriheavy, ציון התצורה הרצויה והפיצול train. אין צורך לבקש אישור גישה מראש. הקבצים נשמרים בפורמט Parquet בחלוקה לאלפי קבצים, כאשר התצורה הגדולה לבדה מחולקת למאות שארדים. אם אתם רוצים את כל ההיקף, תצטרכו לטעון כל תצורה בנפרד ולחבר ביניהן בעזרת concatenate_datasets, אבל מומלץ להתחיל בקונפיגורציה קטנה כדי לא לפוצץ את האחסון המקומי.

from datasets import load_dataset

ds = load_dataset("mythicinfinity/libriheavy")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והנתונים, והפצה מחדש בלי חובה לשתף את השינויים תחת אותו הרישיון בדיוק. אתם יכולים לאמן עליו מודלים לצרכים פנימיים או למוצרים מסחריים בלי לחשוף את המשקולות, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים המתאימים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗