GPT
T

TangoFlux

קוד פתוח

declare-labרישיון לא דווח2024-12-24

  • text-to-audio
  • endpoints_compatible

מודל ליצירת אודיו מטקסט שנשען על ארכיטקטורת פלאקס ומייצר צלילים עד שלושים שניות. הוא מתאים למי שצריך אפקטים קוליים מהירים באיכות גבוהה של 44.1 קילוהרץ ישירות מקוד פייתון.

  • 3.8 GBמשקל הקבצים
  • 635הורדות בחודש
  • 112לייקים

מה זה

המודל משתמש בבלוקים מסוג FluxTransformer שמשלבים DiT וגם MMDiT, יחד עם שיטת rectified flow שפועלת על ייצוג חבוי מאוטואנקודר וריאציוני. הרעיון כאן הוא חיבור בין תיאור טקסטואלי לבין הגדרת משך זמן מדויקת, כדי לפלוט קובץ שמע בקצב דגימה של 44.1kHz שנמשך עד שלושים שניות לכל היותר.

תהליך האימון שלו חולק לשלושה שלבים ברורים, שכללו אימון מקדים, כוונון עדין, ואופטימיזציית העדפות ייעודית בשם CRPO. השיטה הזו יצרה נתונים סינתטיים ובנתה זוגות העדפה מדורגים כדי לשפר את ההתאמה בין מה שביקשתם בטקסט לבין מה שנשמע בפועל, במקום להסתפק רק בהתאמה סטטיסטית בסיסית של מודלי דיפוזיה רגילים.

מתאים ל

  • מחקר אודיו ואלגוריתמים

    הוא מציג יישום של CRPO ודיפוזיה מבוססת פלאקס, שמתאים לבדיקות ביצועים אקדמיות.

  • אפקטים קצרים למשחקים

    יצירה מהירה של רעשי רקע מוגדרים מראש באורך של עד שלושים שניות בסביבת פיתוח פנימית.

  • בדיקות רעיוניות לפודקאסטים

    הפקת סקיצות של מעברים קוליים וצלילי אווירה לפרויקטים אישיים שאינם למטרות רווח.

איפה זה נופל

היוצרים מדגישים שהעלאת כמות הצעדים לחמישים חיונית לאיכות טובה, מה שאומר שבמהירות המקסימלית שלו הסאונד עלול להישמע בינוני או מרוח. מעבר לזה, המודל מוגבל טכנית לשלושים שניות בלבד, כך שהוא לא מתאים לקטעי רקע ארוכים או פסקולים שלמים בלי לחתוך ולהדביק תוצאות.

שאלות
נפוצות

אפשר להשתמש במודל כדי להפיק סאונד לאפליקציה בתשלום?

לא. היוצרים מציינים במפורש שהמשקלים מיועדים לשימוש מחקרי לא מסחרי בלבד, והם כפופים למספר רישיונות מגבילים של ספקי המידע והתשתית שעליהם הוא אומן.

כמה זמן לוקח לייצר קטע קול של עשר שניות?

הזמן תלוי בחומרה ובכמות הצעדים שתבחרו בקוד. הרצה עם עשרים וחמישה צעדים תהיה מהירה מאוד, אבל בשביל איכות טובה תצטרכו חמישים צעדים שמאטים את קצב היצירה באופן מורגש.

איך מריצים

כדי להריץ אותו מתקינים את החבילה ישירות מהמאגר בגיטהאב בעזרת pip, ומייבאים את מחלקת ההסקה בפייתון. הקבצים שוקלים 3.8 גיגה בייט, כך שכרטיס מסך מודרני פשוט עם שמונה עד שנים עשר גיגה זיכרון יחזיק את העסק בלי בעיה מקומית.

ברירת המחדל של פונקציית היצירה עומדת על עשרים וחמישה צעדים של דגימה, אבל היוצרים ממליצים להעלות לחמישים צעדים אם רוצים איכות סאונד טובה יותר. התוספת הזו מכפילה את זמן הריצה, כך שאם אתם בונים שירות חי שחייב מהירות תצטרכו לבדוק אם עשרים וחמישה צעדים מספקים אתכם.

pip install -U huggingface_hub
hf download declare-lab/TangoFlux

הרישיון

למרות שבדף הראשי לא דווח רישיון מסודר, בטקסט עצמו מובהר שהמשקלים מיועדים למחקר לא מסחרי בלבד. הם כפופים לרישיונות של Stable Audio Open, WavCaps ורישיון הקהילה של Stability AI, כך שאסור לשלב אותו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗