GPT
M

minds14

קוד פתוח

PolyAIcc-by-4.02022-04-05

  • speech-recognition

יש כאן גם סקירה על Poly AI עצמו.

המאגר מרכז הקלטות קוליות של כוונות משתמש בתחום הבנקאות המקוונת ב־14 שפות וניבים שונים. הוא מתאים למי שרוצה לאמן או לבדוק מודלים של זיהוי כוונות ישירות מדיבור ללא תמלול ביניים.

  • 15,904הורדות בחודש
  • 107לייקים

מה זה

הנתונים מגיעים ממערכת מסחרית אמיתית בעולם הבנקאות הדיגיטלית, ומחולקים לפי 14 כוונות שימוש שונות, כמו בקשה לשינוי כתובת. כל רשומה במאגר כוללת קובץ שמע, תמלול בשפת המקור, תרגום של התמלול לאנגלית, מזהה שפה מספרי וסיווג מספרי של הכוונה המבוקשת. קצב הדגימה של קובצי האודיו עומד על 8000 הרץ, מה שמשקף איכות של שיחות טלפון.

המאגר מאורגן לפי תצורות של שפות וניבים, למשל אנגלית מארצות הברית, בריטניה או אוסטרליה, לצד שפות כמו צרפתית, גרמנית, הולנדית וקוריאנית. קיימת גם תצורת all שמרכזת את כלל השפות יחד. כל תצורה כזו מכילה רק חלוקה אחת מסוג אימון, עם כ־600 דוגמאות בכל שפה, ובסך הכל בין 10,000 ל־100,000 רשומות במאגר כולו.

מתאים ל

  • סיווג כוונות מדיבור

    אימון מודלים קוליים שמזהים ישירות את מטרת הלקוח בשיחה טלפונית ללא המרה לטקסט.

  • בדיקת מודלים רב-לשוניים

    הערכת ביצועים והשוואה בין ניבים שונים של אותה שפה, למשל אנגלית בריטית מול אוסטרלית.

  • אימון זיהוי דיבור ממוקד

    התאמת מודלים של תמלול אוטומטי לאוצר מילים ולמונחים בנקאיים נפוצים באיכות שמע נמוכה.

איפה זה נופל

החיסרון הבולט הוא היעדר מוחלט של עברית, כך שהוא לא יעזור לפיתוח מוצר לשוק המקומי אלא למחקר רב-לשוני כללי. המאגר מוגבל לתחום הבנקאות בלבד, והשמע מוקלט ב־8000 הרץ, כך שהוא אינו מייצג איכות אולפן. בנוסף, יש רק כ־600 דוגמאות לכל שפה ואין חלוקות מובנות לבדיקה או ולידציה, מה שמחייב אתכם לחתוך את המידע בעצמכם.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מכיל 14 שפות וניבים בהם אנגלית, צרפתית, גרמנית, ספרדית, קוריאנית ורוסית, אך עברית אינה נכללת בו כלל.

האם מותר להשתמש בנתונים לפיתוח מוצר מסחרי?

כן. הרישיון הוא CC-BY-4.0, שמתיר שימוש מסחרי מלא. עליכם רק לציין את המקור ולתת קרדיט למחברים בהתאם לדרישות הרישיון.

כמה שטח אחסון המאגר דורש?

הנתונים תופסים כ־500 מגה-בייט בסך הכל בדיסק. אם מורידים רק שפה אחת מסוימת, הנפח של קובצי ההורדה הוא מעט נמוך מזה.

האם המאגר מחולק כבר לאימון ולבדיקה?

לא. כל תצורת שפה כוללת רק פיצול אימון יחיד שמכיל כ־600 דוגמאות. אם אתם רוצים להעריך מודל, תצטרכו להפריד בעצמכם חלק מהדוגמאות לצורכי בדיקה.

איך טוענים

הטעינה מתבצעת ישירות דרך ספריית datasets של Hugging Face, תוך ציון שם השפה הרצויה או התצורה הכוללת. הקבצים שמורים בפורמט Parquet, אין צורך בבקשת גישה מיוחדת או באישור ידני, והנפח הכולל בדיסק הוא כ־500 מגה-בייט. השדות המרכזיים לעבודה הם שדה האודיו שמכיל את המערך והקצב, שדה סיווג הכוונה ושדות התמלול.

from datasets import load_dataset

ds = load_dataset("PolyAI/minds14")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב שיתוף באותו רישיון עבור המודל שתאמנו עליו. התנאי המרכזי הוא מתן קרדיט מתאים ליוצרים ולמאמר המקורי של PolyAI.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗