GPT
S

speech_commands

קוד פתוח

googlecc-by-4.02022-03-02

הקלטות באנגלית של מילה בודדת באורך שנייה לאימון מודלים קלים לזיהוי פקודות קוליות. זה הבנצ'מרק הנפוץ לבדיקת סינון רעשים וזיהוי מילות הפעלה במכשירים עם משאבים מוגבלים.

  • 2,256הורדות בחודש
  • 60לייקים

מה זה

המאגר כולל קובצי אודיו בפורמט wav בקצב דגימה של 16000 הרץ, שבהם דוברים מקליטים מילה יחידה שנמשכת עד שנייה אחת, לצד הקלטות של רעשי רקע. הנתונים נאספו במיקור המונים דרך ממשק ייעודי, שבו אנשים התבקשו להקריא מילים מתוך רשימה מוגדרת מראש במשך חמש דקות. ההקלטות חולקו למילים עיקריות כמו פקודות תנועה והפעלה, מילים נלוות שמשמשות רקע שלילי, וקטעי שקט או רעש שנמשכים יותר משנייה.

קיימות שתי גרסאות להורדה. הראשונה כוללת 64,727 קבצים עם 30 מילים שונות, והשנייה מרחיבה את האוצר ל־105,829 קבצים עם 35 מילים, כולל מילים חדשות כמו backward ו־visual. שתי הגרסאות מחולקות מראש לסט אימון, ולידציה ובדיקה, כאשר יש חלוקה מפורשת לפי מזהה הדובר כדי למנוע דליפת מידע בין הסטים.

מתאים ל

  • זיהוי מילות הפעלה מקומי

    אימון מודלים קלים לרכיבי קצה שמזהים פקודות כמו yes, no או stop בזמן אמת בלי חיבור לרשת.

  • בנצ'מרק לסינון רעשים

    בדיקת עמידות של מסווגי אודיו מול רעשי רקע שונים כמו שטיפת כלים באמצעות קובצי השקט וההדמיות.

  • אימון דחיית מילים זרות

    שימוש במילים המשניות כדוגמאות שליליות כדי שהמערכת תתעלם ממילים דומות שאינן פקודות הפעלה.

איפה זה נופל

אין כאן מילה אחת בעברית, כל ההקלטות באנגלית בלבד. הכרטיס לא מפרט את הרכב הדוברים, המבטאים, המגדר או הגילאים שלהם, מה שמקשה לדעת מראש מול אילו מבטאים המודל ייכשל. הנתונים נאספו בין השנים 2017 ל־2018 בסביבות הקלטה ביתיות, והם כוללים רק מילים בודדות ומנותקות. אם המוצר שלכם צריך לזהות פקודות מתוך דיבור רציף או משפטים שלמים, הדאטהסט הזה לא משקף את המציאות.

שאלות
נפוצות

האם אפשר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים שיימכרו ללקוחות. התנאי היחיד הוא מתן קרדיט ליוצרי המאגר והתחייבות לא לנסות לזהות את הדוברים.

האם יש במאגר דגימות בעברית?

לא. כל הנתונים הוקלטו באנגלית בלבד. אם המטרה היא זיהוי פקודות בעברית, המאגר לא יעזור לאימון ישיר אלא לכל היותר לבדיקת ארכיטקטורות של מודלים.

איך נאספו קובצי האודיו?

ההקלטות נאספו במיקור המונים דרך האינטרנט. המשתתפים קראו מילים בודדות שהוצגו להם במפגש הקלטה שנמשך כחמש דקות.

למה יש שתי גרסאות שונות?

גרסה 0.01 פורסמה ב־2017 עם 30 מילים ופחות קבצים. גרסה 0.02 יצאה ב־2018, הרחיבה את המאגר ל־35 מילים והוסיפה עשרות אלפי הקלטות נוספות של דוברים שונים.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות בחירת הגרסה הרצויה, v0.01 או v0.02. אין צורך באישור גישה מיוחד, המאגר פתוח להורדה ישירה. השדות המרכזיים הם audio שמכיל את המערך המפוענח, label שמחזיר אינדקס מספרי של המילה או הרעש, speaker_id לזיהוי הדובר, ו־is_unknown שמסמן אם המילה שייכת לקבוצת מילות הרקע. יש לגשת ישירות לאינדקס הדגימה לפני שליפת שדה האודיו כדי למנוע פענוח כבד של כל הקבצים בזיכרון, וצריך לחתוך קטעי שניות אקראיים מקובצי הרעש, כי הם ארוכים יותר משנייה אחת.

from datasets import load_dataset

ds = load_dataset("google/speech_commands")

הרישיון

הרישיון הוא cc-by-4.0. מותר להשתמש בנתונים לצרכים מסחריים, לשנות אותם ולאמן עליהם מודלים בלי הגבלה, בתנאי שנותנים קרדיט מתאים למחברים המקוריים מבית גוגל. הרישיון לא דורש לפתוח את הקוד או את המודל שלכם באותו רישיון. תנאי השימוש כוללים התחייבות מפורשת לא לנסות לחשוף את זהות האנשים שתרמו את קולם להקלטות.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗