GPT
G

GTSinger

קוד פתוח

GTSingerרישיון לא דווח2024-06-12

מאגר שירה רב לשוני מקיף שמחבר קבצי אודיו של טכניקות שירה שונות לתווים מוזיקליים ותמלול פונטי. הוא מתאים במיוחד למי שבונה מודלים ליצירת שירה או ניתוח ביצועים קוליים מורכבים.

  • 20,194הורדות בחודש
  • 41לייקים

מה זה

המאגר כולל עשרות אלפי קטעי שירה שמחולקים לפי שפות, זמרים, סגנונות וטכניקות שירה ספציפיות כמו שירה נשיפתית. כל דגימה מגיעה כסט של ארבעה קבצים מרכזיים: קובץ אודיו בפורמט wav, קובץ תווים מוזיקליים בפורמט musicxml, קובץ תמלול ותזמון פונטי בפורמט TextGrid, וקובץ json שמכיל נתונים נלווים על הקטע.

בתיקיית העיבודים יש קובצי metadata ומיפוי פונמות לכל שפה בנפרד, כולל סינית, אנגלית, ספרדית, גרמנית ורוסית. בנוסף לקטעי השירה המעובדים, החוקרים צירפו גם נתוני דיבור תואמים עבור כל שפה כדי לאפשר השוואה או אימון משולב בין דיבור לשירה.

מתאים ל

  • אימון מודלים להפקת שירה

    חיבור ישיר בין תווים בפורמט MusicXML לקובצי אודיו ותזמונים מדויקים מאפשר ללמד מודלים לשיר מטקסט ותווים.

  • זיהוי וסיווג טכניקות קוליות

    החלוקה המובנית לפי סגנונות כמו שירה נשיפתית מתאימה למחקר ופיתוח אלגוריתמים לניתוח שירה וביצועים קוליים.

  • המרת דיבור לשירה

    זמינות של קטעי דיבור ושירה מתואמים מאפשרת פיתוח מערכות שלוקחות משפט מדובר והופכות אותו לקטע מושר.

איפה זה נופל

אם אתם בונים כלי לשוק הישראלי, אין פה עברית בכלל. השפות הזמינות והמעובדות הן סינית, אנגלית, ספרדית, גרמנית ורוסית, כאשר לפי שמות הקבצים והחוקרים יש נוכחות בולטת מאוד לסינית. המאגר פורסם באמצע 2024 כך שההקלטות עדכניות, אך מבנה הקבצים מפוצל ומחייב התאמות קוד ונתיבים מקומיים לפני שאפשר להזין אותו לרשת.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

בדף המאגר עצמו הרישיון מוגדר כלא דווח, אך הטקסט מציין שהוא חופשי לשימוש ומפנה לקובץ תנאים פנימי. ללא רישיון קוד פתוח מוכר ומוגדר רשמית, שימוש מסחרי מהווה סיכון משפטי. מומלץ לקרוא את קובץ התנאים המקומי לפני שילוב שלו במוצר.

האם המאגר כולל נתונים בעברית?

לא, אין במאגר עברית. השפות שזמינות כרגע הן סינית, אנגלית, ספרדית, גרמנית ורוסית. אם היעד שלכם הוא שירה בעברית, תצטרכו לאסוף או למצוא מאגר אחר.

כמה קבצים יש במאגר ואיך מקבלים אותם?

המאגר כולל 93,994 קבצים שמחולקים לפי שפות, זמרים ורצועות שמע. הגישה חופשית לגמרי ואינה דורשת אישור מוקדם. אפשר להוריד את הקבצים ישירות מ־Hugging Face או דרך קישור Google Drive שהחוקרים פרסמו.

מה ההבדל בין המאגר הזה למאגרי שירה אחרים?

בניגוד למאגרים שמכילים רק אודיו גולמי או מילים, כאן כל קטע מגיע עם תווים מלאים, קובצי TextGrid מפורטים ותיוג של טכניקת השירה. בנוסף, החוקרים הוסיפו נתוני דיבור תואמים עבור חלק מהשפות כדי לסייע באימון מודלים מגוונים.

איך טוענים

המאגר מכיל קרוב למאה אלף קבצים, כך שהורדה ישירה דרך Hugging Face דורשת מקום פנוי משמעותי וזמן. החוקרים מעמידים קישור חלופי לתיקיית Google Drive. לפני תחילת העבודה צריך להגדיר ידנית בקובצי ה־metadata את הנתיב המוחלט לקובצי האודיו בדיסק שלכם, ולחבר בין השפות השונות במידה ותרצו לאמן על יותר משפה אחת במקביל.

from datasets import load_dataset

ds = load_dataset("GTSinger/GTSinger")

הרישיון

הרישיון בדף המאגר מוגדר כלא דווח, אך המפתחים מפנים לקובץ תנאים פנימי ומציינים שהשימוש הוא בחינם. בפועל, כל עוד אין רישיון סטנדרטי ומוכר, אסור להניח שמותר להשתמש בו למוצר מסחרי. יש לבדוק את תנאי הקובץ הייעודי לפני אימון מודל שמיועד להפצה.

הרישיון המלא ב־Hugging Face ↗