GPT
S

svq

קוד פתוח

googlecc-by-4.02025-05-12

הקלטות קוליות של שאלות קצרות ב־17 שפות ו־26 אזורים. המאגר מיועד לבדיקת מודלים תחת רעשי רקע אמיתיים כמו תנועה, דיבור ומדיה.

  • 21,423הורדות בחודש
  • 57לייקים

מה זה

המאגר מכיל בין מאה אלף למיליון הקלטות של שאלות קוליות קצרות, שמקורן בטקסטים מתוך מערכי הנתונים של XTREME-UP, הכוללים את TyDi QA ותרגומים של XOR QA. כ־700 דוברים הקליטו את עצמם במכשירים אישיים כמו טלפונים וטאבלטים, עם מגבלה של עד 250 הקלטות לאדם כדי לשמור על גיוון. המאגר כולל גם מידע דמוגרפי מדווח על מגדר וגיל.

ההקלטות חולקו באופן אחיד בין ארבעה תנאי סביבה: הקלטה נקייה ושקטה, הקלטה עם דיבור ברקע ממכשיר אחר, רעשי מדיה כמו מוזיקה או טלוויזיה, והקלטה בתוך כלי תחבורה נוסע כמו רכב, אוטובוס או רכבת. כל הנתונים משוחררים כאוסף שלם אחד ללא חלוקה מראש לאימון, בדיקה או ולידציה.

מתאים ל

  • הערכת מודלי זיהוי דיבור

    בדיקת עמידות של מודלי ASR תחת רעשי תחבורה, מוזיקה או דיבור רקע.

  • בנצ'מרק למענה קולי לשאלות

    מדידת ביצועים של מערכות שאילתות קוליות מרובות שפות לפי מדדי MSEB.

  • בדיקת חילוץ ייצוגי קול

    בחינת מודלי הטמעת שמע על הקלטות ממכשירים ניידים שונים.

איפה זה נופל

הבעיה המרכזית לפיתוח מקומי היא שאין פה עברית. המאגר מתמקד בשפות כמו ערבית, אנגלית, הינדית, אינדונזית ויפנית. בנוסף, אין חלוקה מובנית לסט אימון ובדיקה. החוקרים מציינים שיצירת חלוקה נקייה ללא חפיפת דוברים או טקסטים תגרור אובדן של כ־40% מנפח הנתונים. אם מתכננים לאמן עליו, חייבים לבנות פיצול זהיר כדי לא להעריך מודל על דוברים שהוא כבר שמע.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מכיל 17 שפות ו־26 אזורים, בהן ערבית, אנגלית, פינית, הינדי, יפנית, קוריאנית ועוד, אך עברית אינה נכללת בו כלל.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, רישיון CC-BY 4.0 מאפשר שימוש מסחרי מלא. הדרישה המרכזית היא מתן ייחוס מתאים לחוקרים ולגוגל שפרסמו את המאגר.

למה אין חלוקה מובנית לאימון ובדיקה?

החוקרים בחרו לשחרר את כל הנתונים כמקשה אחת כדי לא לאבד מידע. חלוקה קפדנית ללא חפיפת טקסטים ודוברים הייתה מוחקת כ־40% מנפח ההקלטות.

איך נאספו ההקלטות בפועל?

כ־700 דוברים הקליטו שאלות מטקסטים של בנצ'מרק XTREME-UP בטלפונים ובטאבלטים שלהם. כל דובר הוגבל לעד 250 הקלטות, תחת ארבע סביבות שמע שונות.

איך טוענים

טוענים את המאגר ישירות מתוך Hugging Face בעזרת הספרייה datasets דרך המזהה שלו. הגישה פתוחה ואין צורך בבקשת אישור מיוחדת. הקבצים שמורים בפורמט Parquet ומחולקים לקבצי שמע לפי שפה, אזור ותנאי הרעש של ההקלטה, בסך הכל 136 קבצים במאגר. בעבודה איתו צריך לשים לב לשדות של קובץ השמע, הטקסט של השאלה, תנאי ההקלטה ונתוני הדובר. מכיוון שאין חלוקה מובנית לסטים של אימון ובדיקה, צריך להגדיר חלוקה עצמאית בקוד.

from datasets import load_dataset

ds = load_dataset("google/svq")

הרישיון

המאגר מופץ תחת רישיון CC-BY 4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של המידע, ואינו מחייב שיתוף של תוצרים באותו רישיון. החובה העיקרית היא מתן קרדיט מתאים ליוצרים לפי דרישות הרישיון, מה שמאפשר לאמן ולהעריך מודלים פנימיים או מסחריים כל עוד עומדים בתנאי הייחוס.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗