GPT
U

unsupervised_peoples_speech

קוד פתוח

MLCommonsרישיון לא דווח2023-11-10

  • audio
  • unsupervised

מעל מיליון שעות של דיבור באנגלית ללא תמלול, שנמשכו ישירות מתוך ארכיון האינטרנט. זה מאגר עצום שמיועד בעיקר למי שרוצה לאמן מודלי שמע בסיסיים בלי תיוג ידני.

  • 22,944הורדות בחודש
  • 81לייקים

מה זה

המאגר מורכב כולו מקובצי אודיו גולמיים שהורדו באמצעות ה־API של Archive.org, בלי שעברו שום עיבוד מוקדם, חיתוך או יישור ידני. מרבית קטעי השמע נעים בין דקה לעשר דקות, אם כי ישנם 14 קבצים חריגים שאורכם עולה על מאה שעות. מבחינת איכות טכנית, 99 אחוזים מקובצי הקול מגיעים בקצב דגימה של 44.1 קילוהרץ, והשאר מתפזרים על פני קצבים מוכרים כמו 16, 24 ו־48 קילוהרץ או הגדרות מותאמות אישית.

בכרטיס לא מופיעים תמלולים לטקסט אלא שלושה קובצי מטא-דאטה נלווים בלבד בפורמט JSONL. הראשון כולל פירוט רישיונות פרטני לכל קובץ, השני מציג זיהוי שפה שחושב באמצעות מודל Whisper Large V3, והשלישי מכיל חותמות זמן של זיהוי פעילות קולית שחולצו עם Silero VAD.

מתאים ל

  • אימון בסיס ללא פיקוח

    אימון מקדים של מודלי שמע גדולים על מאגר קול גולמי באנגלית בהיקף של מיליון שעות.

  • למידת ייצוגי קול

    חילוץ מאפיינים וקטוריים של דיבור טבעי באמצעות למידה מונחית עצמית.

  • סיווג קטעי אודיו

    אימון מסווגים לזיהוי קול ומאפייני שמע שונים בהסתמך על חותמות הפעילות הקולית.

איפה זה נופל

ההטיה כאן ברורה מאוד. כל החומר מגיע מ־Archive.org, ולכן הוא משקף רק את מה שמשתמשי האתר בחרו להעלות לשם לאורך השנים. כמעט כל הדיבור הוא באנגלית במבטא אמריקאי, כך שאין כאן מענה למבטאים אחרים או שפות נוספות, ועברית בוודאי לא תמצאו פה. בנוסף, היעדר תמלול אנושי הופך אותו ללא שמיש לאימון מודלי זיהוי דיבור ישירים, אלא רק ללמידה ללא פיקוח. כדאי גם לזכור שזיהוי השפה וחותמות הקול מבוססים על מודלים אוטומטיים ולא נבדקו ידנית.

שאלות
נפוצות

האם יש במאגר שמע בעברית?

לא. המאגר מוגדר לשפה האנגלית, והיוצרים מציינים שכמעט כל ההקלטות הן באנגלית במבטא אמריקאי. אין כאן נתונים מקומיים או שפות אחרות.

האם מותר להשתמש בנתונים למוצר מסחרי?

החומרים נאספו מרישיונות CC-BY ו־CC-BY-SA, והמאגר מופץ ברישיון CC-BY-SA 4.0. שימוש מסחרי אפשרי, אך חובת השיתוף הזהה דורשת לוודא ששחרור המודל או הנגזרות עומד בדרישות הרישיון.

כמה נפח אחסון צריך לפרויקט כזה?

מדובר במעל מיליון שעות אודיו המחולקות לאלפי קובצי tar, כשכל אחד מהם שוקל כ־5 גיגה-בייט בממוצע. יש צורך בעשרות טרה-בייט פנויים וחיבור מהיר מאוד כדי לנהל את כל הקבצים.

האם הדאטהסט כולל טקסט לתמלול?

לא. מדובר בקובצי שמע בלבד ללא שום תמלול טקסטואלי נלווה. הקבצים היחידים שנוספו מעבר לשמע הם קובצי מידע על רישיונות, חותמות זיהוי קול של Silero VAD וסיווג שפה אוטומטי של Whisper.

איך טוענים

הנתונים מחולקים לאלפי ארכיוני tar תחת התיקיות audio ו־audio2, כאשר כל ארכיון שוקל כ־5 גיגה-בייט בממוצע. בסך הכל יש במאגר 11,138 קבצים, כך שמדובר בנפח עצום שמחייב תשתית אחסון רצינית ורוחב פס מסיבי לפני שמתחילים להוריד. הגישה למאגר פתוחה ללא צורך באישור מיוחד. קובצי ה־JSONL חיוניים לפילוח ראשוני, במיוחד vad_results כדי לחתוך שקט ו־lang_id_results כדי לוודא שאתם אכן ניגשים לקטעים הרלוונטיים.

from datasets import load_dataset

ds = load_dataset("MLCommons/unsupervised_peoples_speech")

הרישיון

למרות שבמטא-דאטה הראשי לא דווח רישיון רשמי, בתיאור עצמו נכתב שהדאטהסט מופץ תחת CC-BY-SA 4.0, והמקורות נלקחו מרישיונות CC-BY ו־CC-BY-SA. משמעות הרישיון היא חובת שיתוף זהה. אם תאמנו עליו ותפיצו נגזרת, תצטרכו לשחרר אותה תחת אותם תנאים ובמתן קרדיט מתאים. שימוש מסחרי מותר בעיקרון, אבל סעיף ה־ShareAlike מחייב בדיקה משפטית זהירה לגבי מעמד המודל המאומן.

הרישיון המלא ב־Hugging Face ↗