GPT
W

whisper_transcriptions.reazon_speech_all

קוד פתוח

japanese-asrרישיון לא דווח2024-09-07

המאגר כולל קטעי שמע ביפנית לצד תמלול מקורי, תרגום אנגלי שנוצר עם GPT-3.5 וטוקנים תואמי Whisper. הוא מיועד למי שמאמן או מעריך מודלי דיבור ותרגום ביפנית.

  • 14,418הורדות בחודש
  • 15לייקים

מה זה

כל רשומה במאגר כוללת שמע שנדגם בקצב של 16000 הרץ, תמלול טקסטואלי, תרגום אנגלי שנוצר באמצעות GPT-3.5, ושני שדות של טוקנים מסוג מספר שלם עבור Whisper. המקור שנרמז בשם הדאטהסט הוא ReazonSpeech, אך כרטיס המאגר הנוכחי לא מפרט כיצד הקטעים סוננו או מאיזה תוכן הם הוקלטו.

המאגר מחולק לעשרות תצורות שונות שנקראות subset. ברוב התצורות יש עשרות אלפי דוגמאות בכל אחת, כמו 82105, 81918, 81685 או 81703 דוגמאות, בעוד שבתצורות בודדות יש מספר זעום של רשומות, למשל 3 דוגמאות ב־subset_5, 5 דוגמאות ב־subset_21 ו־7 דוגמאות ב־subset_37.

מתאים ל

  • אימון זיהוי דיבור ביפנית

    אימון מודלים להמרת דיבור לטקסט ביפנית באמצעות קובצי שמע של 16000 הרץ ותמלול תואם.

  • תרגום דיבור ישיר לאנגלית

    בניית מודלי שמע לטקסט המתרגמים יפנית לאנגלית בעזרת התרגומים המוכנים מ־GPT-3.5.

  • אימון מודלי Whisper

    שימוש ברצפי הטוקנים המוכנים מראש להזנה מהירה של נתונים למודלי Whisper.

איפה זה נופל

הכרטיס לא מדווח על תהליך הסינון, ההטיות בדיבור, זהות הדוברים או גיל ההקלטות. בנוסף, התרגום לאנגלית נוצר באמצעות GPT-3.5 ולא תורגם בידי אדם, כך שייתכנו שגיאות או הזיות בטקסט האנגלי. אין במאגר עברית בכלל. לפני שילוב במודל, חובה לבדוק ידנית את איכות ההתאמה בין האודיו לתמלול.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא מומלץ לגעת בו לפרויקט מסחרי כרגע. הרישיון לא דווח בעמוד המאגר, וללא הגדרה רשמית של תנאי השימוש אתם חשופים לסיכון של הפרת זכויות יוצרים.

כמה המאגר הזה שוקל?

המאגר כולל 5220 קבצים ומחולק לעשרות תצורות. כמעט כל תצורה מלאה דורשת הורדה של קרוב ל־12 גיגה בייט, כך שהורדת כל התצורות יחד תדרוש מאות גיגה בייטים של שטח אחסון.

האם יש במאגר תמיכה בעברית?

אין במאגר עברית כלל. השמע והתמלולים הם ביפנית, ותרגומי המכונה שצורפו הם באנגלית בלבד.

איך טוענים

טוענים את המאגר ישירות מספריית datasets של Hugging Face דרך ציון שם התצורה הרצויה, למשל subset_0. סך הנתונים כולל 5220 קבצים בפורמט Parquet, וכל תצורה סטנדרטית שוקלת קרוב ל־12 גיגה בייט להורדה. אין צורך באישור גישה מיוחד כדי להוריד. השדות החיוניים לעבודה הם audio, transcription, וסדרות הטוקנים עבור Whisper.

from datasets import load_dataset

ds = load_dataset("japanese-asr/whisper_transcriptions.reazon_speech_all")

הרישיון

הרישיון לא דווח בכרטיס המאגר. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בנתונים, לא לאימון מודל פנימי ולא למוצר מסחרי, כל עוד היוצרים לא הגדירו תנאים ברורים.

הרישיון המלא ב־Hugging Face ↗