GPT
A

audioldm2

קוד פתוח

cvsspcc-by-nc-sa-4.02023-08-21

  • diffusers
  • safetensors

מודל דיפוזיה שמייצר אפקטים קוליים, דיבור ומוזיקה ישירות מטקסט. פתרון מתאים למי שצריך לחולל אודיו כללי מקומית דרך diffusers בלי להסתמך על שירותים חיצוניים.

  • 347Mפרמטרים
  • 8.3 GBמשקל הקבצים
  • 17,130הורדות בחודש
  • 72לייקים

מה זה

המודל מקבל תיאור טקסטואלי ומחזיר קובץ שמע בקצב דגימה של 16kHz. הוא מאומן על 1,150,000 שעות של תוכן קולי, ומתוכנן להתמודד עם מגוון רחב של משימות: החל מרעשי רקע ואפקטים קוליים, דרך דיבור אנושי ועד קטעי מוזיקה בסיסיים.

זוהי גרסת הבסיס מתוך שלוש שפורסמו במחקר. בעוד שהרשת המרכזית שלו, ה־UNet, כוללת כ־350 מיליון פרמטרים, המערכת כולה מגיעה ל־1.1 מיליארד פרמטרים יחד עם מקודדי הטקסט וה־VAE. ההבדל בינו לבין גרסת ה־large טמון בעיקר בעומק הרשת, מה שמשפיע ישירות על כושר ההפרדה של הצליל מול מהירות החישוב.

מתאים ל

  • מחולל אפקטים למשחקים

    מתאים ליצירת רעשי רקע, צעדים או מכות פטיש לפי תיאור טקסט ישיר לפיתוח עצמאי.

  • אב טיפוס לסינתזת שמע

    בדיקת היתכנות מהירה של ייצור קול ואודיו ממודל מקומי דרך קוד פייתון סטנדרטי.

  • מחקר אקדמי בעיבוד אותות

    בסיס נוח לניסויים על דיפוזיה באודיו תחת תנאי הרישיון הלא-מסחרי של המחברים.

איפה זה נופל

איכות השמע רגישה מאוד ל־seed הנבחר ומשתנה מריצה לריצה, כך שלעיתים קרובות תצטרכו לייצר מספר תוצאות לאותו הפרומפט כדי לקבל קטע שמיש. בנוסף, המודל מתקשה להבין שמות ספציפיים או מושגים מופשטים, והוא מגיב טוב רק לתיאורים כלליים ומפורטים עם שמות תואר ברורים. קצב הדגימה עומד על 16kHz בלבד, מה שמגביל את איכות הצליל הסופית ולא יתאים למי שמחפש הפקה מוזיקלית נקייה בתדרים גבוהים.

שאלות
נפוצות

האם המודל מתאים ליצירת מוזיקה מורכבת?

הוא יכול לייצר מוזיקה, אבל זו גרסה כללית. אם המטרה היא מוזיקה בלבד, עדיף להשתמש בגרסת audioldm2-music שאומנה ייעודית לכך, או בגרסת ה־large לקבלת צליל עמוק יותר.

איך אפשר לשפר את איכות האודיו שהמודל מוציא?

השתמשו בתיאורים מפורטים עם שמות תואר, שלבו negative prompt לסינון איכות נמוכה, והעלו את מספר צעדי הדיפוזיה ל־200. מומלץ גם לייצר 3 דגימות במקביל ולתת למודל לדרג את הטובה מביניהן.

איך מריצים

ההרצה נעשית ישירות בעזרת הספרייה diffusers החל מגרסה 0.21.0, יחד עם transformers ו־accelerate. הקבצים שוקלים 8.3 גיגה-בייט ומחייבים שימוש בכרטיס מסך תומך CUDA, כאשר טעינה ב־float16 היא הדרך המעשית לעבוד איתו בלי לחנוק את הזיכרון.

זמן הריצה תלוי בעיקר במספר צעדי הדיפוזיה שתגדירו, כשרמת ברירת המחדל המומלצת בדוגמאות היא 200 צעדים. אם אתם מתכוונים לייצר אודיו בזמן אמת, קחו בחשבון ש־200 צעדים ייקחו זמן מורגש על כרטיס בודד, במיוחד אם מבקשים לחולל כמה דגימות במקביל כדי לבחור את הטובה ביותר.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("cvssp/audioldm2")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות ברורה וחד-משמעית: שימוש לא מסחרי בלבד. אסור לשלב את המשקולות או את התוצרים שלו במוצר מסחרי בתשלום, וכל שינוי או פיתוח שמבוסס עליו חייב להיות מופץ תחת אותו הרישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗