GPT
M

multilingual-speech-commands-15lang

קוד פתוח

artur-muratovcc-by-4.02025-05-27

  • speech
  • audio
  • keyword-spotting
  • speech-commands
  • multilingual

המאגר מרכז הקלטות קוליות קצרות של פקודות ב־15 שפות שונות עם אוגמנטציות מוכנות מראש. הוא מיועד למי שרוצה לאמן מודל זיהוי פקודות קוליות רב-לשוני במבנה שתואם לסטנדרט של גוגל.

  • 167,294הורדות בחודש
  • 16לייקים

מה זה

הנתונים מורכבים מכמעט מאה אלף קובצי שמע בפורמט WAV, המחולקים לתיקיות לפי פקודות כמו yes, no, go, stop ואחרות. כל פקודה מייצגת מילה אחת מתוך אוצר המילים המוכר של Google Speech Commands. ההקלטות נלקחו מתוך מאגרים ציבוריים קיימים בערבית, טורקית, רוסית, קזחית, טטרית, אנגלית, צרפתית ושפות נוספות.

היוצר לא רק אסף את החומרים אלא גם הפעיל עליהם מניפולציות שמע סטנדרטיות: הוספת רעש, שינויי גובה צליל (pitch) והזזות בזמן כדי להגדיל את החוסן של המודלים. החלוקה לאימון, ולידציה ובדיקה כבר מוגדרת מראש באמצעות קובצי טקסט ייעודיים, לצד מיפוי של תוויות ושפות בקובצי JSON נפרדים.

מתאים ל

  • זיהוי פקודות קוליות

    אימון מודלים שמזהים מילות מפתח בסיסיות בכמה שפות במקביל עבור מכשירי קצה או רובוטים.

  • בדיקת ביצועים רב-לשונית

    הערכת מודלי שמע קיימים מול סט בדיקה תקני שמבוסס על מבנה Google Speech Commands.

  • אימון מודלים קלים ל־IoT

    פיתוח מסווגים קטנים ומהירים לפקודות שמע שמתאימים לחומרה מוגבלת משאבים בכמה שווקים.

איפה זה נופל

החיסרון המרכזי למפתח המקומי הוא היעדר מוחלט של עברית. המאגר מוגבל ל־15 שפות בלבד, ומכיל רק מילים שחופפות לאוצר המילים המקורי של גוגל, מה שמונע ממנו להתאים לפקודות מותאמות אישית. בנוסף, מדובר בהרחבה מלאכותית של קבצים קיימים באמצעות רעש ושינויי גובה צליל. אוגמנטציה סינתטית כזו עלולה ליצור הטיות אקוסטיות ולא תמיד מדמה בצורה מדויקת רעשי רקע אמיתיים מהשטח.

שאלות
נפוצות

האם יש במאגר עברית?

לא. המאגר כולל 15 שפות ספציפיות כמו אנגלית, ערבית, רוסית, צרפתית, קזחית ואחרות, אך עברית אינה חלק מהן.

האם מותר להשתמש במאגר למוצר מסחרי?

כן. רישיון cc-by-4.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים שנמכרים כמוצר. החובה היחידה היא לתת קרדיט מתאים ליוצר המאגר ולחוקרים שיצרו את מאגרי המקור.

מה ההבדל בין המאגר הזה לבין Google Speech Commands המקורי?

המאגר המקורי של גוגל התמקד באנגלית בלבד. המאגר הזה לוקח את אותו אוצר מילים ואותו מבנה תיקיות, ומרחיב אותו ל־15 שפות שונות עם אוגמנטציות אקוסטיות מוכנות מראש.

איך המידע חולק לקבוצות אימון ובדיקה?

היוצר צירף קובצי טקסט ייעודיים בשם training_list, validation_list ו־testing_list. הקבצים האלה מכתיבים במדויק אילו קובצי שמע שייכים לכל שלב, כך שאין צורך לפצל את המאגר לבד.

איך טוענים

המאגר כולל 99,965 קבצים ופתוח להורדה ישירה ללא צורך בהרשאה מיוחדת. הגישה אליו נעשית באמצעות היררכיית תיקיות לפי שמות הפקודות. לפני שמתחילים לטעון את השמע, כדאי לקרוא את קובצי ה־JSON שממפים את השפות והמחלקות, ולהסתמך על קובצי הטקסט שמגדירים מראש את החלוקה ל־training, validation ו־testing כדי לקבל תוצאות שניתן להשוות למחקרים אחרים.

from datasets import load_dataset

ds = load_dataset("artur-muratov/multilingual-speech-commands-15lang")

הרישיון

המאגר מופץ ברישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי ומאפשר לשנות את החומרים או לאמן עליהם מודלים ללא חובה לשתף את התוצר באותו רישיון. התנאי המרכזי כאן הוא מתן ייחוס מלא הן ליוצר המאגר והן למאגרי המקור המקוריים שצוינו בתיעוד.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗