GPT
S

SmoothConv

קוד פתוח

qualialabsAIcc-by-nc-4.02026-05-28

  • speech
  • conversational-speech
  • chinese

שיחות אמיתיות בסינית מרובת ערוצים עם תיוג אנושי מדויק של חלוקת תורות ודיבור חופף. זה מיועד למי שבונה מודלים של דיאלוג קולי חי וצריך בנצ'מרק איכותי ולא דאטהסט מסונתז.

  • 18,512הורדות בחודש
  • 20לייקים

מה זה

המאגר כולל 100.53 שעות של שיחות מרובות משתתפים בסינית, המחולקות ל־2,503 קובצי אודיו באורך ממוצע של כ־144 שניות. ההקלטות נעשו בסביבות מרובות ערוצים וכוללות תופעות דיבור טבעיות כמו קטיעת דברים, שתיקות ותגובות רקע. מומחים אנושיים תייגו את החומר ברמת המקטע, כולל תמלול ותגיות של מצבי תורות.

המבנה מאורגן לפי שני תרחישים מרכזיים. תיקיות שמתחילות בקידומת edu מכילות שיחות מתחום ההוראה הפרטית, ותיקיות עם הקידומת none_Edu מוקדשות לשיחות חולין חברתיות. לכל קובץ שמע בפורמט wav מצורף קובץ json באותו שם שמכיל את כל נתוני המקטעים.

בתוך קובץ התיוג, כל מקטע כולל זמני התחלה וסיום מדויקים בשניות, שיוך לערוץ הקלטה, תמלול עם סימוני רעש או שתיקה, ומאפייני דובר כמו גיל, מגדר, רגש ותיאור סביבה.

מתאים ל

  • זיהוי תורות שיחה

    אימון מודלים לזיהוי רגעי סיום דיבור וקטיעת משפטים בשיחה רציפה לפי תגיות turn.

  • הערכת מודלי דיאלוג מלא

    בדיקת ביצועים למערכות full-duplex שצריכות להאזין ולדבר בו זמנית בערוצים נפרדים.

  • זיהוי קולות רקע וחפיפות

    ניתוח מקרים שבהם משתתף אחד מאשר את דברי השני בלי לתפוס את תור הדיבור המרכזי.

איפה זה נופל

כל התוכן מוקלט בסינית בלבד, ולכן הוא לא רלוונטי לאימון ישיר על עברית או שפות מערביות, אלא רק למחקר על ארכיטקטורות של ניהול שיחה. הנתונים מוגבלים לשני תחומים בלבד, שיעורים פרטיים ושיחות חולין, כך שסגנונות דיבור מקצועיים או רשמיים נעדרים מכאן. היוצרים מציינים שתיוג אנושי עלול לכלול שגיאות ודורש תשומת לב להטיות דמוגרפיות, וחלק משדות הסביבה מסומנים כלא ידועים.

שאלות
נפוצות

האם אפשר לאמן על הדאטהסט מודל למוצר מסחרי?

לא. הרישיון הוא CC BY-NC 4.0, שמונע כל שימוש מסחרי ישיר או עקיף. הדאטהסט נועד לצורכי מחקר, אקדמיה ובנצ'מרק בלבד.

האם יש בדאטהסט תמיכה בעברית?

אין עברית כלל. כל 100 השעות מוקלטות בסינית ומתומללות בסינית בלבד.

איך המידע נאסף וסונן?

ההקלטות נאספו משיחות טבעיות אמיתיות בהסכמת המשתתפים, תוך הסרת פרטים מזהים. התיוג בוצע ידנית על ידי מומחים אנושיים שסימנו גבולות מקטעים, תמלול ומצבי שיחה.

מה ההבדל בין המאגר הזה לבין DuplexConv?

שני המאגרים מגיעים מאותו מקור שיחות. SmoothConv מכיל 100 שעות עם תיוג ידני מוקפד שמתאים להערכה ולכוונון, בעוד DuplexConv מכיל 2,000 שעות שתויגו בסיוע מודלי שפה ומיועד לאימון מודלים מקדים.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בפקודה load_dataset("qualialabsAI/SmoothConv"). אין צורך בבקשת אישור גישה מיוחדת, וההורדה פתוחה. המאגר מכיל 5,008 קבצים בסך הכל, שהם זוגות של קובצי wav מרובי ערוצים וקובצי json תואמים. בעבודה עם קובצי התיוג, השדות המרכזיים בתוך רשימת instances הם channelIndex שמציין את הערוץ, זמני start ו־end, והאובייקט attributes שמכיל את מצב ה־turn, כולל ערכים כמו complete, incomplete או backchannel.

from datasets import load_dataset

ds = load_dataset("qualialabsAI/SmoothConv")

הרישיון

הרישיון הוא CC BY-NC 4.0. המשמעות פשוטה: השימוש מוגבל למחקר ולמטרות לא מסחריות בלבד, עם חובת מתן קרדיט ליוצרים. אסור להשתמש בנתונים האלה למוצר מסחרי, לשירות בתשלום, או לאימון של מודל שמיועד למכירה או לרווח עסקי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗