GPT
M

magenta-realtime

קוד פתוח

googlecc-by-4.02025-06-17

  • magenta-realtime
  • tf-keras

זהו מודל פתוח לייצור מוזיקה רציפה בזמן אמת, הנשלט באמצעות טקסט או דגימות קול. הוא מיועד למי שרוצה לשלב אלתור מוזיקלי אינטראקטיבי בהופעות חיות או במשחקים.

  • 254הורדות בחודש
  • 556לייקים

מה זה

גוגל שחררה כאן מודל שנוצר מאותו המחקר שמאחורי MusicFX DJ ומשמש לייצור אודיו מוזיקלי סטריאופוני ב־48kHz באופן מתמשך. המערכת מחברת בין שלושה רכיבים: קודק אודיו בשם SpectroStream שממיר גלי קול לטוקנים, רכיב MusicCoCa שמייצר ייצוג משותף לטקסט ולמוזיקה, ומודל שפה מסוג טרנספורמר שמייצר את המוזיקה עצמה. השליטה במוזיקה מתבצעת על ידי תיאור טקסטואלי, דגימת אודיו קיימת, או שילוב משוקלל של שניהם יחד תוך כדי נגינה.

המודל אומן על כ־190 אלף שעות של מוזיקת סטוק אינסטרומנטלית באמצעות מעבדי TPUv6e של גוגל. בשונה מרוב כלי יצירת המוזיקה המייצרים קטעים מוגדרים מראש של כמה עשרות שניות, הכלי הזה נבנה לפעול ברצף, מקבל חלון הקשר קצר ומייצר מקטעים חדשים כל הזמן בהתאם לשינויים שהמשתמש מכניס בהנחיות.

מתאים ל

  • אלתור מוזיקלי על במה

    שליטה בזמן אמת בצליל ובסגנון במהלך הופעה חיה באמצעות שינוי טקסט או דגימות קול.

  • פסקול דינמי למשחקי מחשב

    יצירת מוזיקת רקע מתמשכת שמגיבה לפעולות השחקן ולסביבה המשתנה ברצף וללא חיתוכים.

  • מחקר בייצוגי אודיו

    חילוץ ייצוגים מוזיקליים מהרכיבים הפנימיים לטובת זיהוי סגנונות ומשימות סיווג.

איפה זה נופל

המודל מוגבל לחלון הקשר קולי של עשר שניות בלבד. המשמעות היא שהוא אינו זוכר מה נוגן לפני כן, ולכן אינו מסוגל לבנות מבנה שיר שלם וארוך כמו בתים ופזמון, אלא רק מקצבים, מלודיות ומהלכי אקורדים קצרים. בנוסף, הוא פועל במקטעים של שתי שניות, כך ששינוי בהנחיית הסגנון ישפיע על המוזיקה רק אחרי שתי שניות או יותר, מה שמייצר השהיה מסוימת בשידור חי.

רוב המידע שעליו אומן מורכב ממוזיקה מערבית ללא מילים. המודל מתקשה לכסות מסורות מוזיקליות לא מערביות, ואינו יודע לשיר מילים אמיתיות אלא רק קולות רקע והמהומים לא ברורים.

שאלות
נפוצות

האם המודל יכול לשיר מילים לפי טקסט שנזין לו?

לא. המודל אומן בעיקר על מוזיקה אינסטרומנטלית, והוא אינו מתוכנן לקבל מילים לשירה. במקרים מסוימים הוא עשוי להפיק המהומים או צלילים דמויי קול אנושי, אך מדובר בהברות חסרות משמעות ולא במילים אמיתיות.

כמה מהר הוא מגיב לשינויים בהוראות בזמן אמת?

הטרנספורמר מייצר את האודיו במקטעים של שתי שניות בכל פעם. כתוצאה מכך, שינוי של טקסט ההנחיה או החלפת דגימת האודיו ישפיעו על המוזיקה המנוגנת בעיכוב של שתי שניות לפחות מרגע שליחת הפקודה.

איך מריצים

המודל פותח ב־JAX ו־T5X ודורש שימוש בחבילת magenta-realtime הייעודית. גוגל מספקת מחברת Colab המאפשרת להריץ אותו ישירות על גבי מעבדי TPU שזמינים בחשבונות חינמיים, לצד קוד מקור מלא ב־GitHub.

גודל המודל מוגדר כקטן יחסית ומאפשר פריסה בסביבות עם משאבים מוגבלים או בהופעות חיות. אם אתם צריכים מגוון סגנונות רחב בהרבה, גוגל מפנה להשתמש במקום זאת ב־API המסחרי של Lyria RealTime, שמציע כיסוי סגנוני עמוק יותר אך אינו מודל משקולות פתוח להרצה עצמית.

pip install -U huggingface_hub
hf download google/magenta-realtime

הקבצים

רשימת הקבצים לא נקראה.

הרישיון

המשקולות של המודל משוחררות תחת רישיון CC-BY-4.0, וקוד המקור מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט מתאים לגוגל. גוגל אינה דורשת זכויות על תוצרי המוזיקה שתפיקו, אך תנאי השימוש אוסרים במפורש על יצירת תוכן שמפר זכויות יוצרים של צד שלישי, ומטילים את מלוא האחריות המשפטית על התוצרים עליכם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗