GPT
M

MMAU-Pro

קוד פתוח

gamma-lab-umdcc-by-nc-4.02025-08-26

המאגר כולל 5,305 שאלות ותשובות מתויגות מומחה להערכת מודלים על אודיו מורכב. הוא בודק יכולות כמו הסקת מסקנות מקטעים של עד עשר דקות, מוזיקה מתרבויות שונות ותפיסה מרחבית.

  • 5,004הורדות בחודש
  • 21לייקים

מה זה

הנתונים מכילים 5,305 זוגות של שאלות ותשובות שנאספו ישירות מהשטח ותויגו בידי מומחים. המשימות מחולקות ל־49 מיומנויות תפיסה והסקה שונות, וכוללות שאלות רב ברירה, שאלות פתוחות ומעקב אחר הוראות מוגדרות. הקטעים עצמם מכסים דיבור, צלילי סביבה, מוזיקה ושילובים ביניהם, כולל קבצים שמגיעים עד לעשר דקות ועיבוד של כמה קובצי שמע במקביל.

חלק ניכר מוקדש למוזיקה רב תרבותית משמונה אזורים שונים בעולם, כולל המזרח התיכון, הודו, אפריקה, סין ואמריקה הלטינית. המטרה היא לבחון ידע כללי מבוסס קול, נושאי מדע והבנה מרחבית, מעבר למבחני שמע סטנדרטיים של תמלול בלבד.

מתאים ל

  • בנצ'מרק למודלי שמע

    מדידת יכולות תפיסה והסקה של מודלים מול 5,305 שאלות מורכבות בשמע.

  • בדיקת הבנת שמע ארוך

    בחינת יכולת המודל לחלץ פרטים מקבצי קול שנמשכים עד עשר דקות ברצף.

  • איתור הטיות תרבותיות

    השוואת ביצועי מערכות זיהוי על מוזיקה מאזורים שונים כמו המזרח התיכון.

איפה זה נופל

היוצרים מודים בהטיה מובהקת ברמת הביצועים בין אזורים שונים. מודלים נבדקים הצליחו היטב על מוזיקה מערבית וסינית, אך כשלו באודיו מהודו ומאמריקה הלטינית. בנוסף, מודלים מובילים מגיעים לדיוק של כ־52 עד 59 אחוזים בלבד לעומת כ־78 אחוזים בבני אדם, מה שמעיד על רמת קושי גבוהה ותסכול אפשרי בהערכה. אין פירוט בכרטיס לגבי תמיכה בשפות ספציפיות מעבר לחלוקה האזורית, כך שאי אפשר להסתמך עליו לבדיקת עברית בלי לסנן את החומר ידנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון הוא cc-by-nc-4.0 ואוסר על כל פעילות מסחרית. הוא נועד למחקר אקדמי והערכת מודלים פנימית בלבד. כל שימוש בתוך מוצר שמוכר מנויים או שירותים מהווה הפרה של תנאי השימוש.

האם המאגר כולל דאטה בעברית?

הכרטיס מציין כיסוי מוזיקלי מהמזרח התיכון, אך אינו מפרט לגבי דיבור בעברית או שפות ספציפיות בתוך השאלות. מרבית משימות ההוראות והשאלות מנוסחות באנגלית. אם אתם בונים מודל שמיועד לשוק המקומי, תצטרכו להוריד את קובץ הבדיקה ולבדוק ידנית אם יש בו דגימות רלוונטיות.

כמה שטח אחסון צריך כדי לעבוד איתו?

המאגר כולל ארבעה קבצים עיקריים, בהם test.parquet וקובץ מכווץ של קטעי הקול בשם data.zip. קובצי שמע שנמשכים עד עשר דקות דורשים נפח אחסון משמעותי לפריסה מקומית. כדאי לפנות כמה עשרות גיגה בייטים פנויים לפני ההורדה של כלל ההקלטות.

במה הוא שונה ממאגרי הערכת שמע אחרים?

הוא מציב רף קשה בהרבה שמערב 49 מיומנויות הסקה שונות, ולא רק תמלול או זיהוי צליל בודד. בנוסף הוא מכיל קבצים ארוכים מאוד של עד עשר דקות, דגימות אודיו מרחבי ומשימות שדורשות האזנה לכמה קבצים במקביל. הפער בין הציון האנושי של 78 אחוז לציוני המודלים המובילים ממחיש שמדובר במבחן קשוח במיוחד.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפקודת load_dataset עם המזהה gamma-lab-umd/MMAU-Pro. המאגר פתוח לציבור וכולל קובץ test.parquet לצד ארכיון שמע בשם data.zip. לצורך הרצת ההערכה המקורית, מוסיפים לקובץ הפארקט עמודת חיזויים בשם model_output ומריצים את סקריפט הבדיקה הרשמי שבודק דמיון וקטורי, התאמת מחרוזות ושיפוט של מודל שפה.

from datasets import load_dataset

ds = load_dataset("gamma-lab-umd/MMAU-Pro")

הרישיון

הרישיון הוא cc-by-nc-4.0, שאינו מתיר שימוש מסחרי בשום צורה. אתם רשאים לשתף, לשנות ולהתבסס עליו למטרות מחקר ובדיקה פנימית בלבד, תוך מתן קרדיט מלא ליוצרים. אי אפשר להשתמש בתוצרים שלו בתוך מודל שמוטמע במוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗