GPT
N

NOTSOFAR

קוד פתוח

microsoftרישיון לא דווח2025-01-22

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

המאגר מרכז הקלטות אודיו רב ערוציות של פגישות אמיתיות וסימולציות כבדות. הוא מיועד למי שבונה או בודק מערכות תמלול והפרדת דוברים מורכבות במכשיר בודד.

  • 17,800הורדות בחודש
  • 25לייקים

מה זה

הנתונים מחולקים לשני חלקים עיקריים. החלק הראשון מכיל 315 פגישות מוקלטות באורך ממוצע של שש דקות, שנאספו בתוך 30 חדרי ישיבות שונים. המפגשים האלה כוללים 35 דוברים ייחודיים בקבוצות של 4 עד 8 משתתפים, עם תיוגים ספציפיים לתנאי שטח כמו דיבור ליד לוח, רעשי רקע פתאומיים וחפיפות דיבור טבעיות.

החלק השני מיועד לאימון ומכיל עד 1,000 שעות של שמע מסונתז. הסימולציה נבנתה באמצעות 15,000 פונקציות תמסורת אקוסטיות אמיתיות, במטרה לדמות פיזור קול אותנטי בחדר. המאגר שפורסם בהאגינג פייס מכיל קובצי wav מרובי ערוצים לצד מטא נתונים בפורמט json שמגדירים את מאפייני ההתקנים.

מתאים ל

  • הפרדת קולות רציפה

    אימון ובדיקה של מודלי CSS להפרדת מספר דוברים שמדברים במקביל בחדר.

  • מדידת דיוק תמלול פגישות

    הרצת בדיקות השוואתיות לפי מדדי tcpWER על תמלול רב ערוצי של שיחות.

  • זיהוי וחלוקת דוברים

    בניית רכיבי דיאריזציה שמסוגלים לזהות מי דיבר ומתי תחת רעשי רקע.

איפה זה נופל

ההקלטות האמיתיות מבוססות על 35 דוברים בלבד, מספר נמוך מאוד שיוצר הטיה מובהקת למאפייני הקול שלהם. הכרטיס מציג ביצועי בסיס עם שיעורי שגיאה גבוהים, 46.8 אחוז שגיאות מילים בערוץ בודד, במיוחד במצבים של ויכוחים עם חפיפות דיבור או דיבור מרוחק ליד לוח. בנוסף, כל החומרים באנגלית ואין ייצוג לשפות אחרות או למבנים שונים של חדרי שיחה מחוץ לתאגידים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, תחת תנאי הרישיון של CC BY 4.0 השימוש המסחרי מותר. הדרישה המרכזית היא מתן קרדיט ברור למפתחים המקוריים במיקרוסופט. אין חובה לפתוח את קוד המקור של המודל שלכם.

כמה שעות שמע יש בדאטהסט ואיך מורידים אותן?

המאגר כולל 1,000 שעות של שמע מסונתז וכן 315 הקלטות פגישות באורך של כ־6 דקות כל אחת. להורדת הנפחים הגדולים האלה מומלץ להשתמש בכלי AzCopy מול השרתים בבלוב סטורג ולא בהורדה ישירה דרך הדפדפן.

האם המאגר כולל הקלטות בעברית?

לא, כל השיחות והסימולציות מבוססות על השפה האנגלית בלבד. אם המטרה היא לאמן מערכת לפגישות בעברית, המאגר יכול לשמש בעיקר לאימון רכיבי הפרדת שמע אקוסטית ולא לרכיבי שפה או זיהוי מילים.

מה מייחד את הדאטהסט הזה לעומת מאגרי תמלול רגילים?

הוא מתמקד בבעיית המיקרופון הבודד והמרוחק בחדר שבו יושבים מספר אנשים. המאגר מציע הקלטות רב ערוציות לצד סימולציות שמדמות חפיפות קול, רעשי רקע של כתיבה על לוח ותנועה במרחב.

איך טוענים

אין צורך לבקש אישור גישה מיוחד, אבל שיטת המשיכה העיקרית של קובצי האודיו הגדולים נשענת על AzCopy וכתובות של Azure Blob Storage ולא רק על טעינה ישירה מהאגינג פייס. סקריפטי ההרצה דורשים סביבת לינוקס, פייתון 3.10 והתקנת חבילות כמו ffmpeg. קובצי הנתונים כוללים קובצי שמע מרובי ערוצים כמו ch0.wav וקובצי devices.json שמחזיקים את הגדרות ההקלטה.

from datasets import load_dataset

ds = load_dataset("microsoft/NOTSOFAR")

הרישיון

למרות שבדף המאגר ברירת המחדל מציגה שלא דווח רישיון, בתוך התיעוד מצוין במפורש רישיון Creative Commons Attribution 4.0 International. הרישיון הזה מתיר שימוש מסחרי, שינוי ושילוב במודלים, כל עוד ניתן קרדיט מתאים ליוצרים. המודלים שתאמנו על הדאטהסט לא מחויבים ברישיון פתוח.

הרישיון המלא ב־Hugging Face ↗