GPT
O

open-yap-1k

קוד פתוח

TheAgenticDataCompanycc-by-4.02026-09-02

  • speech
  • audio
  • full-duplex
  • conversational

המאגר מספק שיחות טלפון ספונטניות באנגלית מוקלטות בשני ערוצים נפרדים ברוחב פס רחב. הוא מיועד למי שמאמן מודלי שיחה מלאים ורוצה תזמון מדויק של קטיעות וצחוק בלי להסתמך על הפרדת דוברים סינתטית.

  • 1,687הורדות בחודש
  • 65לייקים

מה זה

הנתונים נאספו באמצעות אפליקציה ייעודית שדימתה שיחות טלפון שגרתיות בין אנשים שמכירים זה את זה, כולל חברים, עמיתים לעבודה ובני משפחה. מכיוון שהדוברים שוחחו על נושאים חופשיים מהסביבה הטבעית שלהם ולא בחדרים אקוסטיים, ההקלטות כוללות רעשי רקע אותנטיים, כניסה לדברי האחר, השלמת משפטים ושינויי קצב דיבור.

כל שיחה מחולקת לשני קבצי אודיו נפרדים החולקים ציר זמן משותף, מלווים בתמלול ממוחשב ברמת מילה ומדדים כמו רוחב פס אפקטיבי וציוני רעש רקע. המאגר המלא מונה 1,602 שיחות בהיקף של אלף שעות, בעוד שבדף הציבורי מופיעה רק דגימה ידנית של 16 שיחות באורך כולל של 8.9 שעות.

מתאים ל

  • אימון מודלי Full-Duplex

    לימוד תזמון שיחה, קטיעות תגובה וקולות רקע בזכות ערוצים מופרדים על ציר זמן זהה.

  • מערכות דיבור לטקסט

    בדיקת עמידות מודלי תמלול ברעשי רקע אמיתיים ובדיבור ספונטני ומהיר.

  • מודלי TTS עם פרוזודיה טבעית

    למידת עצירות, צחוק והיסוסים בדיבור אנושי שאינו מוקרא מטקסט כתוב מראש.

איפה זה נופל

התמלולים הופקו אוטומטית באמצעות מודל Deepgram Nova-3 ולא עברו אימות ידני, כך שעלולות להיות בהם שגיאות. כל השיחות הן באנגלית בלבד, ורובן המכריע מבוסס על דוברים מארצות הברית, כך שאין כאן ייצוג למבטאים ישראליים או לשפות נוספות. בנוסף, אף שהקבצים נשמרים באריזה של 48kHz, ציוד הקצה של המשתתפים מגוון, וחלק מהמסלולים הוגבלו בפועל לרצועה צרה של 8kHz עקב שימוש באוזניות בלוטות'.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המדגם זמין ברישיון חופשי, והמאגר המלא זמין בחינם לשימוש מסחרי ומחקרי לאחר אישור בקשת הגישה. עם זאת, הסכם השימוש אוסר למכור את קובצי האודיו עצמם או ליצור שיבוט קולי מזהה של הדוברים.

האם הדאטהסט רלוונטי לעבודה בעברית?

לא ברמת השפה. כל השיחות הוקלטו באנגלית, ורוב הדוברים הם מארצות הברית וממדינות דוברות אנגלית אחרות. הוא יכול לסייע רק בלמידת דינמיקה כללית של תזמון שיחה או התנהגות מודל דו-ערוצי שאינה תלויה בשפה עצמה.

במה הוא שונה ממאגרי שיחות ותיקים כמו Fisher או Switchboard?

המאגרים הישנים הוקלטו באיכות טלפונית נמוכה של 8kHz וכללו זרים ששוחחו על נושאים מוגדרים. כאן מדובר בשיחות חופשיות בין אנשים שמכירים, באיכות של 48kHz, מה שיוצר דינמיקה שכוללת הרבה יותר קטיעות, צחוק וחפיפות דיבור.

איך מורידים את כל אלף השעות?

המאגר המלא לא נמצא ישירות בעמוד הדאטהסט. צריך להגיש בקשה באתר החברה, לפרט את מטרות הפרויקט, ולאחר אישור מקבלים גישה להורדה ישירה או סנכרון ל־S3.

איך טוענים

המדגם בעמוד מוגש בפורמט WebDataset או כקבצי tar להורדה ישירה דרך ספריית datasets. כל רשומה כוללת את שני ערוצי השמע כקובצי flac וקובץ json שמכיל תמלול ומטא-דאטה מקיף על החומרה ורמות השמע. כדי לעבוד עם כל אלף השעות צריך להגיש בקשה באתר החברה ולקבל גישה לפורטל או העברה ישירה לדלי S3, בכפוף להסכם שימוש ייעודי.

from datasets import load_dataset

ds = load_dataset("TheAgenticDataCompany/open-yap-1k")

הרישיון

המדגם הקטן שמופיע בעמוד מפורסם תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי ומחקר תמורת מתן קרדיט. לעומת זאת, המאגר המלא של אלף השעות כפוף להסכם שימוש נפרד מול החברה. ההסכם מתיר אימון מודלים והטמעתם במוצרים מסחריים, אך אוסר במפורש הפצה מחדש של הדאטהסט, ניסיונות זיהוי של הדוברים או שכפול קולות גנרטיבי שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗