GPT
G

gemini-flash-2.0-speech

קוד פתוח

shb777apache-2.02025-01-16

  • audio
  • llm
  • synthetic

מאגר קול סינתטי מבוסס ג'מיני עם שני דוברים באנגלית בלבד. הוא מרכז 284 שעות שמע איכותיות בפורמט מוכן לאימון מודלי דיבור ושימש בפועל לאימון קוקורו.

  • 1,173הורדות בחודש
  • 60לייקים

מה זה

המאגר כולל 47,256 משפטי טקסט, כאשר לכל משפט מוצמדות שתי הקלטות אודיו מקבילות, אחת של הקול פאק והשנייה של הקול קורי, בקצב דגימה של 24 קילוהרץ. סך הכל מדובר על 94,512 קבצי אודיו באורך ממוצע של כעשר שניות לקובץ, החל מקטעים קצרים של חצי שנייה ועד הקלטות של דקה וחצי.

מקורות הטקסט מגוונים ומורכבים מוויקיפדיה, פוסטים מרדיט, פודקאסטים, מאמרי דעה, שיחות שירות לקוחות וטקסטים שנוצרו במודלי שפה, יחד עם נתח קטן של חדשות טכנולוגיה, כלכלה ומספרים. תהליך ההמרה לפונמות בוצע בעזרת הכלי מיסאקי, וחלק מהרשומות כוללות ערכים חסרים בשדה הזה.

ההקלטות הופקו כולן באופן סינתטי באמצעות הממשק החי של ג'מיני פלאש 2.0. כל רשומה במאגר מציגה את הטקסט, אורך הפונמות, ומערכי האודיו המלאים של שני הקולות לצד נתיב הקובץ המקורי.

מתאים ל

  • אימון מודלי הקראה

    אימון וכיול של מודלי טקסט לדיבור באנגלית על שני קולות נקיים ואיכותיים.

  • זיהוי דיבור אוטומטי

    אימון מערכות תמלול על בסיס משפטים סינתטיים עם תמלול טקסטואלי מדויק.

  • מחקר קול סינתטי

    בדיקת איכות הפלט של ג'מיני מול מודלים פתוחים אחרים בעבודה עם פונמות.

איפה זה נופל

המאגר כולו באנגלית ואין בו מילה אחת בעברית או מבטא שאינו אמריקאי מובהק של גוגל. מעבר לזה, כל הקבצים הוקלטו על ידי שני קולות בלבד, פאק וקורי, מה שמגביל מאוד אימון שדורש מגוון קולי רחב או התמודדות עם רעשי רקע של העולם האמיתי. חלק מהרשומות מכילות ערכי נאל בשדה הפונמות, כך שחובה לסנן או לתקן אותן ידנית לפני שמריצים פייפליין של אימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוצהר במאגר הוא אפאצ'י 2.0 שמאפשר שימוש מסחרי מלא ואימון מודלים לכל מטרה. עליכם רק לכלול את עותק הרישיון המקורי ולתת קרדיט ליוצר המאגר. כדאי לזכור שחלק מטקסט המקור מבוסס על ויקיפדיה ומקורות רשת נוספים.

האם המאגר כולל תמיכה בעברית או בשפות נוספות?

לא, המאגר כולל אך ורק דיבור באנגלית. שני הקולות הם הקולות המובנים של גוגל באנגלית, כך שהוא לא יעזור לאימון מודלים בעברית. שימוש בו יתאים רק למוצרים שפונים לקהל דובר אנגלית.

מאיפה הגיעו קבצי האודיו והטקסט שבפנים?

כל קבצי האודיו נוצרו באמצעות מודל ג'מיני פלאש 2.0 של גוגל דרך ממשק המולטימודל החי שלהם. הטקסטים שהוקראו לוקטו ממאגרי נתונים קיימים, ביניהם ויקיפדיה, שיחות שירות, מאמרים ופוסטים מרדיט. תהליך הפונטיזציה הופק בנפרד באמצעות הכלי מיסאקי.

האם אפשר להשתמש במאגר לאימון מודל דיבור כללי לעולם האמיתי?

לא מומלץ להסתמך עליו לבדו לתרחישי עולם אמיתי, מכיוון שיש בו רק שני דוברים קבועים והקלטות סינתטיות נטולות רעש. מודל שיאומן עליו בלבד יתקשה להתמודד עם מגוון מבטאים, איכויות מיקרופון שונות ורעשי סביבה. הוא מתאים בעיקר כתוספת נקייה או לפרויקטים שמתמקדים באיכות קולית גבוהה באנגלית.

איך טוענים

הנתונים מחולקים למאה קבצי פארקט בתוך תיקיית הדאטה, ללא צורך באישור גישה מוקדם או בהרשמה מיוחדת. בגלל שמדובר במערכי אודיו מלאים ולא רק בקישורים, מומלץ להשתמש בהזרמה ישירה בקוד במקום להוריד את כל המאגר בבת אחת. הרשומות כוללות ישירות את שדות האודיו של שני הדוברים, לצד שדה הטקסט ואורך הפונמות.

from datasets import load_dataset

ds = load_dataset("shb777/gemini-flash-2.0-speech")

הרישיון

המאגר פורסם תחת רישיון אפאצ'י 2.0, שמתיר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם. הדרישה העיקרית היא מתן קרדיט ושמירה על הצהרת הרישיון המקורית, בלי חובת שיתוף של הנגזרות תחת אותו רישיון בדיוק. עם זאת, הטקסטים נאספו ממקורות שונים כמו ויקיפדיה, ומומלץ לבדוק את התאמתם ליישום הקצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗