GPT
B

big_bench_audio

קוד פתוח

ArtificialAnalysismit2024-12-13

יש כאן גם סקירה על Artificial Analysis עצמו.

הדאטהסט מציע גרסאות קוליות לשאלות היגיון מורכבות מתוך Big Bench Hard. הוא נבנה כדי לבדוק אם מודלי שמע ישירים באמת מבינים בעיות לוגיות, ולא רק ממירים דיבור לטקסט.

  • 11,482הורדות בחודש
  • 38לייקים

מה זה

המאגר מכיל בדיוק 1,000 קובצי אודיו בפורמט MP3, שמחולקים שווה בשווה בין ארבע קטגוריות חשיבה: כשלים לוגיים, ניווט במרחב, ספירת פריטים ופתרון בעיות שקרנים. לכל קטגוריה הוקצו 250 שאלות שנלקחו במקור מהבנצ'מרק של Big Bench Hard, עם תוספת קבועה של הוראת מענה בסוף כל שאלה כדי למנוע חיתוך מילים בהקלטה.

ההקלטות לא בוצעו באולפן עם שחקנים אלא סונתזו ישירות ממנועי דיבור של OpenAI, מיקרוסופט Azure ואמזון Polly, בסך הכל 23 קולות שונים שנבחרו באקראי. היוצרים תמללו חזרה את הקבצים, חישבו מרחק לוינשטיין מול הטקסט המקורי, ובדקו ידנית 35 הקלטות שקיבלו ציון התאמה נמוך מ־0.85 כדי לוודא שאין עיוות בשאלות.

כל רשומה מורכבת מארבעה שדות פשוטים בלבד: מזהה מספרי, שם הקטגוריה, נתיב לקובץ השמע והתשובה הרשמית הנכונה שמשמשת להערכת הביצועים.

מתאים ל

  • הערכת מודלי דיבור

    בדיקת יכולת ההיגיון והחישוב של מודלי שמע מקצה לקצה ללא צורך בהמרת ביניים לטקסט.

  • מדידת צינורות תמלול וטקסט

    בחינה השוואתית של שרשראות עיבוד קוליות ישנות מול מודלים קוליים רב-מודליים חדשים.

  • אימות יציבות שמע

    מדידת הפגיעה בביצועי הסקת מסקנות כאשר מזינים שאלה בדיבור לעומת הזנת אותה שאלה כטקסט כתוב.

איפה זה נופל

ההקלטות כולן באנגלית ומבוססות בלבד על מבטאים מארצות הברית ומבריטניה, כך שאין כאן שום ייצוג למבטאים זרים או שפות אחרות. מעבר לזה, הדיבור סינתטי וסטרילי לחלוטין. הוא אינו מכיל רעשי רקע, קטיעות או הפרעות דיבור אנושיות אמיתיות, ולכן מודל שיצטיין כאן עדיין עלול לקרוס בשיחה מול לקוח אמיתי בסביבה רועשת.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון הוא MIT ולכן אין מגבלה על שימוש מסחרי, מחקרי או פיתוח מוצרים. הדרישה היחידה היא השארת הייחוס ועותק הרישיון.

האם יש בדאטהסט שאלות בעברית?

לא, כל 1,000 השאלות מוקלטות באנגלית בלבד. הקולות מייצגים מבטאים בריטיים ואמריקאיים ולא כוללים שפות נוספות.

איך השאלות הוקלטו ומאיפה הן הגיעו?

הטקסט נלקח מתוך Big Bench Hard, ונוספה לו בקשה מפורשת לענות על השאלה. לאחר מכן השאלות סונתזו באמצעות 23 קולות שונים משירותי הענן של אמזון, מיקרוסופט ו־OpenAI.

מה ההבדל בין הדאטהסט הזה ל־Big Bench Hard המקורי?

התוכן מבוסס על ארבע קטגוריות נבחרות מהמקור, אך מוגש כקובצי קול MP3 במקום טקסט. הבחירה התמקדה במשימות שאינן דורשות פיענוח איות או סמלים גרפיים שקשה להעביר בדיבור.

איך טוענים

המאגר פתוח לחלוטין להורדה ישירה דרך Hugging Face ואינו דורש אישור גישה מראש. הוא כולל 1,003 קבצים, רובם המוחלט שאלות קוליות בודדות בפורמט MP3 בתיקיית המידע לצד קובץ המטא-דאטה. כשאתם טוענים את הנתונים לקוד, השדות החשובים לריצה הם file_name כדי לטעון את האודיו בפועל ו־official_answer כדי להשוות מול הפלט של המודל שלכם. מאחר שמדובר באלף קובצי קול קצרים, תהליך הטעינה וההרצה על תשתית מקומית קל ואינו מצריך נפחי אחסון חריגים או חומרה מיוחדת.

from datasets import load_dataset

ds = load_dataset("ArtificialAnalysis/big_bench_audio")

הרישיון

המאגר שוחרר תחת רישיון MIT, מה שנותן לכם חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לבצע התאמות ולפתח מודלים פנימיים או מוצרים מסחריים בלי לחלוק את הקוד שלכם. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שמשתמשת בנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗