GPT
R

riffusion-model-v1

קוד פתוח

riffusioncreativeml-openrail-m2022-12-13

  • diffusers
  • stable-diffusion
  • stable-diffusion-diffusers
  • text-to-audio
  • endpoints_compatible

מודל תמונה שמייצר ספקטרוגרמות של אודיו מטקסט, על בסיס סטייבל דיפיוז'ן. הוא מתאים למי שרוצה להפיק מוזיקה בזמן אמת בלי להסתבך עם ארכיטקטורות קול מורכבות.

  • 20.3 GBמשקל הקבצים
  • 953הורדות בחודש
  • 650לייקים

מה זה

במקום לעבד גלי קול ישירות, לקחו כאן את צ'קפוינט הבסיס של Stable Diffusion v1.5 ואימנו אותו מחדש על תמונות של ספקטרוגרמות. המודל שומר על המבנה המוכר של מודל דיפוזיה לטנטי עם מקודד הטקסט הקפוא של CLIP ViT-L/14, ומייצר תמונה שמייצגת תדרים לאורך זמן. לאחר מכן, התמונה הזו מומרת בחזרה לקובץ שמע רגיל.

הרעיון הזה עוקף את הקושי הטבעי של מודלי אודיו ייעודיים. הוא נשען על ההבנה השפתית והיכולות הוויזואליות שכבר קיימות במודל תמונה מאומן, כולל מושגים מוזיקליים שהגיעו מהדאטהסט המקורי. המאגר כולל קבצים בפורמט diffusers, צ'קפוינט מקומפל, גרסת unet שעברה tracing כדי להאיץ את שלב ההסקה, וספריית תמונות מקור שמיועדת לאפליקציית הרשת של המפתחים.

הפרויקט התחיל בכלל כניסוי צדדי של שני מפתחים, סת' פורסגרן והייק מרטירוס. הוא מציע גישה שונה לחלוטין ליצירת מוזיקה בזמן אמת, אבל מוגדר בעיקר ככלי למחקר, יצירה אומנותית ופיתוח כלים חינוכיים.

מתאים ל

  • יצירת לופים מוזיקליים

    מייצר ספקטרוגרמות קצרות לפי תיאור טקסטואלי באנגלית, שמומרות מיד לשמע.

  • מחקר על דיפוזיה

    בדיקת יכולת של מודלי תמונה לייצג מידע שמיעתי דרך ספקטרוגרמות.

  • אימון סגנונות חדשים

    מאפשר כוונון עדין או Dreambooth בעזרת צמדי תמונות ספקטרוגרמה וטקסט.

איפה זה נופל

זה לא מודל אודיו טבעי, והוא מייצר תמונות ולא גלי קול. כל פגם בהמרה של הספקטרוגרמה חזרה לשמע פוגע באיכות הצליל. הכרטיס מציין שהמודל נבנה כפרויקט תחביב ומיועד למטרות מחקר בלבד. הטקסט מוגבל לאנגלית בגלל מקודד CLIP המקורי, והאימון הנוסף דורש סט נתונים ייעודי של ספקטרוגרמות מקושרות לתיאורים טקסטואליים, כך שקשה לדייק בו מעבר ליצירת קטעים קצרים ופשוטים.

שאלות
נפוצות

האם המודל מייצר קובץ אודיו ישירות מהטקסט?

לא. המודל פולט תמונת ספקטרוגרמה בלבד, בדיוק כמו כל מודל סטייבל דיפיוז'ן רגיל. כדי להאזין לתוצאה, צריך לקחת את התמונה ולהמיר אותה לשמע באמצעות תוכנה או הקוד שהמפתחים שיתפו.

האם אפשר להשתמש בפרומפטים בעברית?

לא כדאי. המודל מסתמך על מקודד הטקסט CLIP ViT-L/14 שאומן על אנגלית בלבד. פרומפטים בעברית לא יפיקו את התוצאה הרצויה אלא רעש אקראי.

איך מריצים

המודל מבוסס על ספריית diffusers של Hugging Face, כך שכל סביבת פייתון סטנדרטית שתומכת בה תריץ אותו בלי התאמות מיוחדות. המשקל הכולל של הקבצים במאגר מגיע ל־20.3 ג'יגה בייט ב־61 קבצים שונים, נתון שדורש נפח אחסון פנוי וזמן הורדה משמעותי לפני שמתחילים לעבוד.

מבחינת חומרה, מדובר באותן דרישות מוכרות של מודל תמונה בגודל של סטייבל דיפיוז'ן המקורי. המפתחים צירפו קובץ unet שעבר tracing שמיועד במיוחד לקיצור זמני ההסקה, מה שמקל על מי שמנסה לייצר אודיו ברצף. אם אתם רוצים רק לבדוק סגנונות ספציפיים בלי להחזיק כרטיס גרפי פעיל, אפשר פשוט להשתמש באפליקציית הרשת שהם העלו לרשת.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("riffusion/riffusion-model-v1")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא creativeml-openrail-m, המוכר מסטייבל דיפיוז'ן. הוא מתיר שימוש מסחרי ומחקר, אבל מטיל הגבלות ברורות נגד שימושים פוגעניים או מזיקים. אם אתם משלבים אותו במוצר, חובה לצרף את תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗