GPT
G

AaronZ345/GTSinger

קוד פתוח

AaronZ345cc-by-nc-sa-4.02025-05-11

  • singing
  • audio
  • croissant

מאגר שירה מרובה שפות הכולל 80.59 שעות שירה ו־16.16 שעות דיבור מותאם באולפן מקצועי. הוא נבנה במיוחד עבור מודלים שצריכים ללמוד טכניקות קוליות מדויקות ותווים ריאליסטיים.

  • 9,164הורדות בחודש
  • 17לייקים

מה זה

המאגר מכיל הקלטות אולפן באיכות 48kHz ו־24 ביט של 20 זמרים מקצועיים, המכסים ארבעה מנעדי קול שונים. סך הכל תמצאו פה 80.59 שעות שירה לצד 16.16 שעות של דיבור מותאם מאותם מבצעים. החלוקה הראשית מאורגנת בתשע תיקיות לפי שפות: סינית, אנגלית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, רוסית וספרדית.

בתוך כל שפה יש חלוקה לחמש תיקיות משנה לפי טכניקות קוליות ספציפיות. כל שיר מחולק לקבוצת ביקורת שמושרת בצורה טבעית ללא טכניקה מיוחדת, ולקבוצת בדיקה שבה הזמר משתמש בצורה מודגשת באחת משש טכניקות: קול מעורב, פלסט, קול נשיפתי, קול לועי, ויברטו וגליסנדו.

לצד קובצי האודיו, כל דגימה מגיעה עם קובץ TextGrid שכולל תיוג ידני של גבולות מילים ופונמות, תיוג טכניקה ברמת הפונמה ותיוגי סגנון כלליים כמו רגש, קצב ומנעד. בנוסף, מצורפים קובצי musicxml עם תווים ריאליסטיים וקובצי json לטעינה נוחה של המטא-דאטה.

מתאים ל

  • סינתזת שירה מטקסט ותווים

    אימון מודלים להפקת שירה מבוססת תווים ריאליסטיים וקובצי מוזיקה עם תיוג זמנים.

  • שליטה בטכניקות שירה

    זיהוי וסינתזה מבוקרת של אלמנטים קוליים כמו ויברטו, פלסט ושירה נשיפתית.

  • המרת דיבור לשירה

    שימוש בנתוני הדיבור והשירה המותאמים של אותם זמרים לאימון מודלי העברת סגנון קולי.

איפה זה נופל

אין כאן עברית בכלל, המאגר מתמקד בתשע שפות ספציפיות שרובן אסייתיות ואירופיות. בנוסף, 20 זמרים בלבד מייצרים את כל 80 השעות, כך שהגיוון בזהויות הקוליות ובגווני הקול מוגבל יחסית לכמות השעות. המאגר מתאים בעיקר למחקר בתחום סינתזת שירה ולא יתאים למי שמחפש מגוון רחב של אלפי דוברים שונים או מוזיקה חיה מחוץ לתנאי אולפן יבשים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא, הרישיון המוגדר הוא CC-BY-NC-SA 4.0 שחוסם שימוש מסחרי מכל סוג. הוא מיועד למחקר, הערכה וניסויים אישיים בלבד. אם תאמנו עליו מודל, לא תוכלו למכור שירות סביבו.

האם יש במאגר שירים או הקלטות בעברית?

לא, אין במאגר עברית כלל. הוא מכיל הקלטות בתשע שפות בלבד: אנגלית, סינית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, רוסית וספרדית. תצטרכו לבצע התאמות או אימון המשך כדי לעבוד עם טקסטים מקומיים.

איך נאספו ההקלטות ומה מייחד אותן ממאגרי שירה אחרים?

הנתונים הוקלטו מחדש באולפנים מקצועיים על ידי 20 זמרים בפורמט לא דחוס של 48kHz. המאגר מציע השוואה מבוקרת בין ביצוע טבעי לביצוע עם טכניקות קוליות ספציפיות, בליווי תווים סטנדרטיים ולא רק ייצוגי גובה צליל מופשטים.

אילו קבצים מקבלים עבור כל רצועת שמע?

לכל קטע שירה יש קובץ WAV, קובץ TextGrid עם יישור פונמות ותיוג טכניקות, קובץ MusicXML עם התווים, וקובץ JSON ייעודי. בנוסף יש תיקיית נתונים מעובדים עם קובצי מטא-דאטה ורשימות פונמות לטעינה ישירה.

איך טוענים

המאגר פתוח להורדה חופשית דרך Hugging Face או Google Drive ללא צורך באישור גישה ידני מראש. הוא כולל כמעט 94,000 קבצים בפורמטים שונים: אודיו ב־WAV, מטא-דאטה ב־JSON, תווים ב־MusicXML ותיוגי פונמות ב־TextGrid. אם אתם עובדים עם קובצי ה־metadata.json המוכנים בתיקיית processed, תצטרכו לעדכן את השדה wav_fn כדי שיצביע לנתיב האבסולוטי המקומי שבו שמרתם את קובצי השמע.

from datasets import load_dataset

ds = load_dataset("AaronZ345/GTSinger")

הרישיון

הרישיון הוא cc-by-nc-sa-4.0, וזה אומר שאסור להשתמש בחומרים לשום מטרה מסחרית. מותר להשתמש במאגר למחקר ולפיתוח אישי, אך חובה לתת קרדיט ליוצרים. אם אתם מאמנים מודל על המאגר ומשחררים אותו, אתם מחויבים לפרסם את הנגזרת תחת אותו רישיון בדיוק. המפרסמים מדגישים איסור ספציפי על חיקוי קולות של אנשי ציבור ללא הסכמתם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗