GPT
A

AudioSkills

קוד פתוח

nvidiaother2025-07-10

  • synthetic
  • audio-llm
  • audio-question-answering
  • reasoning
  • speech

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

עשרה מיליון זוגות שאלות ותשובות באנגלית לאימון מודלי שפה על אודיו, מוזיקה ודיבור. המאגר מציע משימות הסקת מסקנות מורכבות על קטעי קול קצרים, אך מכיל טקסט בלבד ללא קבצי הקול עצמם.

  • 1,617הורדות בחודש
  • 105לייקים

מה זה

המאגר מכיל כעשרה מיליון דוגמאות של שאלות ותשובות שמיועדות לפיתוח מודלי שפה מעל אודיו. כל רשומה במאגר כוללת מזהה ייחודי, הפניה לשם קובץ קול, שדה אורך, ומבנה שיחה בין אדם למודל שמכיל את השאלה ואת התשובה המלאה. השאלות בודקות מגוון יכולות ניתוח על קטעי שמע של עד שלושים שניות, ביניהן הסקת מסקנות על רצף זמנים, זיהוי סרקזם בדיבור, ניתוח מצב רגשי, ספירת אירועים אקוסטיים והבנת הקשר של רעשי רקע.

התוכן מחולק לעשרים ותשעה קובצי ג'ייסון שונים לפי מקורות השמע המקוריים, שכוללים ספריות מוכרות כמו אודיוסה, ווקססלב שתיים, מיוזיקקאפס, ואורבןסאונד שמונה קיי. הטקסטים עצמם נוצרו בתהליך היברידי באמצעות מודלי שפה שהופעלו על המטא-דאטה, התמלולים והתיאורים של אותם מאגרים, לצד שילוב אדם בתהליך לצורך דיוק הפרומפטים. המאגר הזה כולל רק את שכבת הטקסט הסינתטית שנבנתה מעליהם, ללא קובצי הקול בפועל.

מתאים ל

  • אימון הבנת רצף זמני בשמע

    לימוד מודלים לזהות איזה צליל קדם לאחר ולהבין שינויים לאורך רצועת שמע קצרה.

  • זיהוי רגשות וטון בדיבור

    כוונון מודלי שפה לחילוץ מצב רגשי וסרקזם מתוך קטעי דיבור של עד חצי דקה באנגלית.

  • ספירת אירועים אקוסטיים

    אימון מערכות מענה לשאלות על כמות הפעמים שצליל מסוים מופיע בהקלטה.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על קטעי שמע קצרים של עד שלושים שניות, כך שאין כאן מענה לשיחות ארוכות או לניבים מקומיים. מעבר לזה, כל התשובות והשאלות נוצרו בצורה סינתטית על ידי מודלי שפה מתוך מטא-דאטה קיים, מה שעלול לייצר שגיאות עובדתיות והזיות שלא נבדקו ידנית שורה אחר שורה. תצטרכו גם לפתור בעצמכם בעיות של קישורים שבורים והורדות עצמאיות של מאגרי המקור לפני שתוכלו לאמן מודל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון של אנבידיה הוא רישיון מחקרי לא מסחרי בלבד. בנוסף, הדאטה נוצר בין היתר עם כלים של אופן איי איי, מה שמוסיף מגבלות שימוש נוספות על התוצרים.

האם הדאטהסט כולל את קובצי האודיו עצמם?

לא, המאגר מכיל רק קובצי ג'ייסון עם שאלות ותשובות. עליכם להוריד את קובצי הקול ישירות מהמאגרים המקוריים של גוגל, בי בי סי ומקורות פתוחים אחרים לפי הקישורים שמצורפים לדוקומנטציה.

האם יש במאגר דגימות בעברית?

לא. המאגר מוגדר כולו באנגלית, וקטעי הדיבור המקוריים נלקחו ממאגרים כמו ווקססלב שמתמקדים בעיקר בשפה זו.

איך נוצרו השאלות והתשובות?

הצוות השתמש במטא-דאטה קיים של קובצי הקול, כמו תמלולים ותגיות, והזין אותו למודלי שפה עם פרומפטים מובנים ליצירת שאלות הסקה מורכבות. התהליך כלל התערבות אנושית לשיפור הפרומפטים אך התוכן עצמו סינתטי.

איך טוענים

אתם מושכים את קובצי הטקסט ישירות מהריפו באמצעות גיט אל אף אס. אין צורך באישור גישה מיוחד למאגר עצמו, למעט קובץ בודד של מיוזיק פור אול שדורש פנייה ידנית למחברים. הבעיה האמיתית מתחילה מיד אחר כך. המאגר מכיל רק קובצי ג'ייסון, וכדי להשתמש בהם תצטרכו להוריד בנפרד עשרים ותשעה מאגרי קול שונים ברשת ולהתאים כל קובץ לשם שמופיע בשדה הסאונד. בנוסף, שדה משך הזמן בג'ייסון לא תמיד מדויק ודורש חישוב מחדש בקוד שלכם.

from datasets import load_dataset

ds = load_dataset("nvidia/AudioSkills")

הרישיון

המאגר מופץ תחת רישיון לא מסחרי של אנבידיה בשם וואן ווי. השימוש מוגבל למחקר בלבד, ואסור לשלב אותו במודלים מסחריים או במוצרים שמניבים הכנסה. בנוסף, מאחר שחלק מהנתונים נוצרו באמצעות כלים של אופן איי איי, חלות עליהם מגבלות השימוש שלהם. אם תורידו את קובצי הקול מהמקורות השונים, תצטרכו לבדוק בנפרד את הרישיון של כל אחד מעשרים ותשעה המאגרים המקוריים.

הרישיון המלא ב־Hugging Face ↗