GPT
T

tango2

רץ בדפדפן

declare-labרישיון לא דווח2023-04-30

  • gradio

מייצרים כאן קבצי אודיו ותוכן קולי ישירות מתיאור טקסטואלי חופשי. הכלי מכוון ליוצרים, מפתחים וחוקרים שמחפשים דגימות קול או אפקטים בלי להקליט בעצמם.

  • הורדות בחודש
  • 92לייקים

מה זה

כותבים תיאור טקסט בתיבת הפרומפט, בוחרים אם רוצים קובץ סופי מסוג wav או mp3, ומקבלים נגן עם האודיו שנוצר. הממשק מציע גם שליטה טכנית במספר צעדי הניקוי, מ־100 עד 200, ובערך ה־guidance scale שנע בין 1 ל־10 עם ברירת מחדל של 3, כדי לקבוע עד כמה התוצאה תיצמד להוראות שלכם.

מאחורי הקלעים רץ Tango 2, שמבוסס על מודל דיפוזיה לקול שעבר יישור מול העדפות משתמשים בשיטת DPO. לפי הקוד, המערכת משלבת בין מודלי שפה ממשפחת T5 לקליטת ההנחיות ופירוק התיאור, לבין רכיבים כמו AudioLDM, Tacotron STFT ודיפיוזרים של אודיו שממירים את המידע לצליל ממשי. היא נשענת על נתוני אימון ממאגר audio-alpaca כדי לפרש הנחיות שמע מורכבות יותר.

מתאים ל

  • יצירת אפקטים קוליים

    הפקת צלילי רקע ואפקטים מותאמים אישית מתוך תיאור מילולי מדויק באנגלית.

  • בדיקת התנהגות מודל DPO

    השוואת התוצאות בין רמות שונות של guidance scale ובחינת איכות הדיפוזיה.

  • הורדת קבצי דגימה

    הורדה מהירה של קבצי wav או mp3 לצורך שיבוץ בבדיקות תוכנה ומדיה.

איפה זה נופל

הבעיה המרכזית כרגע היא טכנית: המצב המדווח הוא שגיאת קונפיגורציה, ולכן אי אפשר לייצר צלילים עד שמנהלי הפרויקט יסדרו את השרת. מעבר לזה, המודל מאומן על הנחיות באנגלית ולא מציג תמיכה בעברית, כך שתיאורים בשפה המקומית צפויים להניב רעש או שקט. טווח הצעדים שמתחיל ב־100 גם דורש זמן עיבוד מסוים בכל בקשה.

שאלות
נפוצות

האם השימוש בעמוד הזה עולה כסף?

הגישה לממשק באתר Hugging Face היא בחינם ואינה דורשת תשלום. כל עוד החומרה הציבורית זמינה, אפשר להשתמש בו ללא עלות.

למה הממשק לא מגיב לי?

האפליקציה נמצאת במצב שגיאת קונפיגורציה, ולכן השרת אינו מופעל כרגע. צריך להמתין לעדכון גרסה תקין מצד המפתחים כדי שתוכל להריץ בקשות.

האם אפשר להריץ את זה באופן מקומי?

כן, הקוד מסתמך על ספריות diffusers ומשקלי Tango2 הזמינים להורדה. תצטרכו להתקין את התלויות ולהריץ את הקוד על חומרה מקומית מתאימה.

מה קורה עם הטקסט שאני מקליד?

הטקסט נשלח למעבד שמריץ את המודל בשרת כדי לייצר את גל הקול. אין התחייבות לפרטיות מוחלטת בהדגמות ציבוריות, לכן אל תכניסו מידע רגיש.

איך משתמשים

הממשק בנוי בפשטות: מקלידים את תיאור הצליל, מתאימים את הסליידרים של הצעדים וההנחיה אם רוצים דיוק שונה, ולוחצים על הפעלה כדי לייצר את הקובץ. העמוד משתמש בחומרת zero-a10g שמקצה כוח עיבוד של כרטיס A10G רק בזמן הריצה עצמה, כך שהמעבד הגרפי אמור לספק זמני תגובה טובים יחסית. עם זאת, נכון לעכשיו מוגדר סטטוס תקלה בקונפיגורציה, כך שהחלון בדפדפן לא באמת ירוץ עד שיתקנו את ההגדרות.

הרישיון

הרישיון של המרחב הזה לא דווח בעמוד הפרויקט. כשהרישיון לא מוגדר רשמית, אין לדעת אם מותר להשתמש בקבצי האודיו שנוצרים לצרכים מסחריים, ואי אפשר להסתמך על זכויות שימוש ברורות בלי בדיקה ישירה מול היוצרים ב־declare-lab.

הרישיון המלא ב־Hugging Face ↗