GPT
L

laions_got_talent

קוד פתוח

laionרישיון לא דווח2024-11-04

יש כאן גם סקירה על LAION עצמו.

המאגר מרכז 110 שעות של קול מסונתז שמציג קשת רחבה של רגשות והבעות לא מילוליות. הוא נבנה עבור מי שמפתח עוזרי קול וצריך דיבור אנושי שחורג מהקראה יבשה ומונוטונית.

  • 7,518הורדות בחודש
  • 41לייקים

מה זה

כל הרשומות במאגר הן הקלטות דיבור סינתטיות שנוצרו באמצעות ממשק הקול של OpenAI דרך Hyprlab, במסגרת פרויקט BUD-E של ארגון LAION בתמיכת אינטל. המטרה של הפרויקט היא לאסוף מגוון רגשי רחב, שכולל תגובות קוליות כמו צחוק, אנחות והתנשפויות על פני נושאי שיחה שונים.

המבנה של הקבצים מחולק לפי רגשות ספציפיים ורמות עוצמה, כמו כעס עז, תדהמה או בלבול, כאשר חלק ניכר מהדוגמאות מבוססות על הקול Alloy. הנתונים לא מגיעים משחקנים אנושיים באולפן, אלא מפרומפטים שנועדו לחלץ מהמודל של OpenAI משחק קולי מובחן.

מתאים ל

  • אימון מודלי דיבור רגשיים

    לימוד מודלי שמע להפיק גווני קול משתנים, החל מזעם ועד התפעלות, במקום הקראה אחידה.

  • זיהוי הבעות קוליות

    בניית מסווגים שמזהים צחוק, אנחות או תדהמה בדיבור באנגלית לצורך הבנת הקשר השיחה.

  • מחקר על דיבור סינתטי

    הערכת היכולת של מודלי שפה מודרניים לשחק בקולם בצורה אמינה לפי פרומפטים מוגדרים.

איפה זה נופל

ההגבלה הראשונה היא השפה. הדוגמאות הן באנגלית, כך שלעברית אין פה מענה ישיר. מעבר לזה, מדובר בדאטה סינתטי שנוצר על ידי מודלים של OpenAI, עם כל הגינונים, מגבלות הסגנון וההטיות של מודלי שמע מסחריים כאלה. אם אתם צריכים דיבור אנושי אמיתי עם פגמים טבעיים של דיבור יומיומי, החומר הזה עלול להישמע מלאכותי ומוגזם מדי בחלק מהרגשות הקיצוניים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון לא דווח בעמוד המאגר, ולכן אין היתר שימוש מסחרי מפורש. בנוסף, היות שהמידע הופק דרך מודלי האודיו של OpenAI, חלים עליו תנאי השימוש של אותם שירותים. מומלץ לבדוק את קובץ ה־LICENSE שבתוך המאגר לפני שמשלבים אותו במערכת פעילה.

האם יש במאגר דאטה בעברית?

לא, הדוגמאות במאגר כוללות קובצי שמע באנגלית בלבד. אם המטרה שלכם היא לאמן מודלים על דיבור בעברית או על רגשות בהקשר שפתי מקומי, המאגר הזה לא ייתן מענה.

מאיפה הגיעו ההקלטות והאם אלו שחקנים אמיתיים?

אלו אינם שחקנים אנושיים. כל ההקלטות יוצרו באופן ממוחשב באמצעות ה־API של OpenAI דרך Hyprlab, בעזרת פרומפטים מגוונים שנבנו כדי לחלץ מהמודל קולות, רגשות והבעות לא מילוליות.

איך טוענים

הנתונים מחולקים ל־494 קבצים, רובם ארכיוני tar שמקובצים לפי שילובים של שפה, קול, רגש ורמת אינטנסיביות. אין צורך באישור גישה מיוחד כדי להוריד אותם, אך בגלל שמדובר בארכיונים דחוסים תצטרכו לפרוק אותם מקומית לפני האימון. שמות הקבצים עצמם מגדירים את מאפייני התוכן, כמו סוג הרגש ועוצמתו, וזה המפתח שלכם לסינון הדגימות.

from datasets import load_dataset

ds = load_dataset("laion/laions_got_talent")

הרישיון

המאגר אמנם כולל קובץ רישיון, אך בעמוד המאגר עצמו לא דווח רישיון רשמי ומוגדר. בנוסף, הנתונים נוצרו בעזרת ממשק ה־API של OpenAI, שתנאי השימוש שלו עשויים להגביל אימון של מודלים מתחרים מסוימים. בלי רישיון ברור שמתיר שימוש מסחרי מפורש, לקחת את זה למוצר מסחרי זו נקודת סיכון משפטית.

הרישיון המלא ב־Hugging Face ↗