GPT
L

LEMAS-Dataset-train

קוד פתוח

LEMAS-Projectcc-by-4.02025-12-04

מעל 150 אלף שעות דיבור בעשר שפות עם סנכרון מלא ברמת המילה. הוא מתאים למי שבונה מודלים של דיבור לטקסט או יצירת קול וצריך חותמות זמן מדויקות לכל מילה.

  • 3,576הורדות בחודש
  • 87לייקים

מה זה

המאגר מציע הקלטות קול קצרות בפורמט MP3 יחד עם תמלול ומידע יישור מפורט. כל רשומה כוללת מזהה ייחודי, נתיב לקובץ האודיו, משך בשניות, הטקסט המקורי, טקסט מנורמל, ורשימה של חותמות זמן וציוני ביטחון עבור כל מילה בנפרד.

הנתונים נאספו ממאגרי אודיו קיימים ברשת ועברו סינון אוטומטי. הסינון השאיר רק קטעים באורך חצי שנייה עד 30 שניות, עם שתיקות של עד 4 שניות בין מילים, וציון ביטחון ממוצע של 0.2 עד 0.5 ומעלה. החלוקה היא לפי עשר שפות, כשסינית, אנגלית, רוסית וספרדית מרכיבות את רוב הנפח, לצד גרמנית, אינדונזית, פורטוגזית, וייטנאמית, צרפתית ואיטלקית.

מתאים ל

  • אימון זיהוי דיבור מרובה שפות

    שימוש ב־150 אלף שעות שמע מתומללות לאימון מודלי ASR בעשר שפות נתמכות.

  • יצירת דיבור עם סנכרון זמנים

    בניית מודלי TTS שמחייבים מיפוי מדויק בין אורך המילה להגייתה בפועל.

  • סנכרון כתוביות אוטומטי

    אימון מודלים שמפיקים חותמות זמן של מילים מתוך קובץ קול קיים.

איפה זה נופל

אין כאן עברית בכלל. הכרטיס לא מציין מהם מקורות האודיו המקוריים שמהם נלקחו ההקלטות, כך שאי אפשר לדעת מראש מה איכות ההקלטה, מי הדוברים ואיזה מבטאים קיימים בפנים. בנוסף, רף הביטחון בסילוק שגיאות סנכרון באימון נמוך למדי, בין 0.2 ל־0.5, מה שאומר שחלק מחותמות הזמן אינן מדויקות וידרשו ניקוי נוסף לפני שימוש רגיש.

שאלות
נפוצות

האם המאגר מתאים לפרויקטים בעברית?

לא. הדאטהסט מוגבל לעשר שפות בלבד: אנגלית, סינית, רוסית, ספרדית, אינדונזית, גרמנית, פורטוגזית, וייטנאמית, צרפתית ואיטלקית. טקסטים שהכילו תווים מחוץ לשפות האלה הוסרו בסינון.

מותר להשתמש בו לאימון מודל מסחרי?

כן. הרישיון המדווח הוא cc-by-4.0, שמתיר שימוש מסחרי מלא. צריך רק לתת קרדיט ליוצרי המאגר לפי תנאי הרישיון.

מאיפה הגיעו כל ההקלטות?

הכרטיס מציין שהנתונים עברו סינון מתוך זוגות טקסט ושמע קיימים, אך אינו מפרט את שמות המאגרים המקוריים. ציון הביטחון בסינון הותאם לכל מאגר מקור בנפרד.

מה הייחוד שלו לעומת מאגרי דיבור אחרים?

היתרון המרכזי הוא קיומן של חותמות זמן וציוני ביטחון ברמת המילה הבודדת לכל אורך 150 אלף השעות. זה חוסך את הצורך להריץ יישור מאולץ בעצמכם.

איך טוענים

המאגר ציבורי לחלוטין ואין צורך באישור גישה. הוא מחולק ל־312 קבצים שמסודרים לפי שפות, כאשר לכל שפה יש צמדים של קובצי מטא-דאטה בפורמט jsonl וארכיוני tar.gz שמכילים את קובצי ה־MP3. מדובר ביותר מ־150 אלף שעות שמע, כך שאי אפשר פשוט לטעון הכל לזיכרון המקומי בלי אחסון ייעודי ותהליך הזרמה. השדות הקריטיים לעבודה הם align שמחזיק את חותמות הזמן של המילים, ו־audio שמפנה לקובץ המתאים בארכיון.

from datasets import load_dataset

ds = load_dataset("LEMAS-Project/LEMAS-Dataset-train")

הרישיון

המאגר מפורסם תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב שיתוף של מודלים או נגזרות באותו רישיון. החובה היחידה היא מתן קרדיט מתאים ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗