GPT
F

F5I9N7A1

קוד פתוח

aanonyyyרישיון לא דווח2025-05-17

מאגר קוריאני עם זוגות שמע וטקסט לכמה דוברים, שמיועד למחקר על מודלי דיבור. אם אתם בונים TTS בקוריאנית ומחפשים נתונים מעובדים עם תיוגים בלשניים, פה יש בסיס מוכן.

  • 236הורדות בחודש
  • 80לייקים

מה זה

המאגר כולל צמדים של שמע וטקסט יחד עם מטא דאטה ותיוגים בלשניים שנועדו ישירות לאימון מודלים. הנתונים מגיעים משני מקורות חיצוניים ציבוריים, הראשון הוא KSS של דובר בודד, והשני הוא EMILIA שמכיל הקלטות רגשיות של קשישים. סקריפטים לעיבוד המידע הזה יושבים במאגר גיטהאב ייעודי של הפרויקט.

למרות שהכרטיס מציין פחות מאלף רשומות, המאגר מחולק לקבצי פארקט רבים בספריית הנתונים, מה שמעיד על עיבוד בחלקים. הנתונים לא מיועדים למי שרוצה הקלטות גולמיות, אלא למי שמחפש קובצי אימון מוכנים שעברו התאמה לצורכי סינתזת דיבור.

מתאים ל

  • אימון מודלי TTS בקוריאנית

    בנייה והערכה של מערכות סינתזת דיבור מרובות דוברים עם תיוגים בלשניים מוכנים.

  • מחקר על דיבור רגשי של קשישים

    בדיקת ביצועי מודלים על הקלטות ייחודיות שמקורן במאגר אמיליה.

  • ניסויי קול של דובר בודד

    שימוש בחלקי הדאטה שנלקחו ממאגר קיי אס אס לצורך השוואת איכות קול נקייה.

איפה זה נופל

המאגר הזה מוגבל לחלוטין לקוריאנית, ואין בו שום ערך לפרויקטים בעברית או בשפות אחרות. מעבר לזה, המקורות שלו מוטים מראש לקולות ספציפיים מאוד, דובר יחיד ממאגר אחד וקולות רגשיים של אנשים מבוגרים מהמאגר השני. לא תמצאו כאן גיוון רחב של דיאלקטים, שכבות גיל שונות או תנאי הקלטה טבעיים מהרחוב.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הכרטיס אוסר במפורש כל שימוש מסחרי ומגדיר שהגישה היא למטרות מחקר ואקדמיה בלבד. בנוסף לא הוגדר רישיון תוכנה תקני, כך שמבחינה משפטית הסיכון גבוה עוד יותר.

האם יש במאגר הקלטות או טקסטים בעברית?

אין בו שום תוכן בעברית. כל הנתונים מבוססים על קורפוסים קוריאניים בלבד, כולל התיוגים הבלשניים שמלווים את קובצי השמע.

איך הנתונים נאספו ועובדו?

היוצרים לקחו שני מאגרים קיימים, KSS ו־EMILIA, העבירו אותם עיבוד מוקדם והוסיפו מטא דאטה ותיוגים. הם פרסמו קישור לקוד המקור ששימש לעיבוד הנתונים בפועל.

האם אפשר להפיץ מודל שאומן על המאגר?

התנאים אוסרים על שחזור זהות קולית ועל הפצה מחדש של הנתונים עצמם. אם המודל שלכם מאפשר יצירה מחדש של קולות הדוברים המקוריים, זה מפר ישירות את תנאי המאגר.

איך טוענים

הנתונים יושבים בקבצי פארקט שמחולקים לעשרות חלקים, מה שאומר שטעינה עם ספריית דאטהסטס תעבוד ישירות מול המאגר ללא צורך באישור גישה ידני. כדאי לשים לב שהקובץ README מפנה לקוד עיבוד חיצוני, כך שאם צריך להבין את מבנה השדות הלשוניים או להריץ מחדש את הסינון, עדיף להציץ ישירות בסקריפטים שפורסמו.

from datasets import load_dataset

ds = load_dataset("aanonyyy/F5I9N7A1")

הרישיון

היוצר לא הגדיר רישיון רשמי וסטנדרטי במטא דאטה, אבל תנאי השימוש בכרטיס ברורים ונוקשים. השימוש מותר למחקר ואקדמיה בלבד, ואסור לחלוטין לשימוש מסחרי. יש איסור מפורש על הפצה מחדש, שינוי הנתונים או ניסיון לשחזור זהות הדוברים, כך שאי אפשר להשתמש בו למוצר מסחרי או לשחרר נגזרות שלו.

הרישיון המלא ב־Hugging Face ↗