GPT
Y

YuE

רץ בדפדפן

fffiloniרישיון לא דווח2025-01-28

  • gradio

ממשק ליצירת שירים מלאים מטקסט לפי סגנון ומילים. מתאים למי שרוצה לבדוק יצירת מוזיקה ושירה מבוססת בינה מלאכותית ישירות בדפדפן.

  • הורדות בחודש
  • 202לייקים

מה זה

אתם כותבים תיאור של ז'אנר מוזיקלי ומדביקים מילים לשיר, והממשק מייצר קובץ שמע של השיר המוגמר. בנוסף לתוצאה המלאה, יש אפשרות לקבל בנפרד את ערוץ השירה ואת ערוץ הנגינה, כך שאפשר להפריד בין הקול לכלים.

מאחורי הקלעים רצה שרשרת של מודלים פתוחים. המערך כולל את YuE בגרסת שבעה מיליארד פרמטרים לייצור מוזיקלי, מודל נוסף של מיליארד פרמטרים, ואת מקודד השמע xcodec_mini_infer שממיר את המידע לקובץ סאונד אמיתי. הממשק כולל גם דוגמאות מובנות שמציגות שילובים של סגנונות ומילים כדי שאפשר יהיה לבדוק את התהליך בלי להמציא הכל מאפס.

מתאים ל

  • הפקת סקיצות לשירים

    יצירת שיר מלא עם שירה וכלים מתוך מילים כתובות כדי לבדוק כיוון מוזיקלי ראשוני.

  • יצירת פלייבקים

    הפרדה בין ערוץ הכלים לקול כדי להפיק רקע מוזיקלי ללא שירה.

  • בדיקת מודלים של YuE

    התנסות ביכולות המודל של שבעה מיליארד פרמטרים בהפקת מוזיקה לפי ז'אנר.

איפה זה נופל

נכון לעכשיו העמוד נמצא במצב מושהה, כך שאי אפשר להריץ אותו ישירות בדפדפן בלי להעיר או לשכפל אותו. כמות המקטעים נעולה על שניים בלבד, מה שמגביל יצירה של יצירות ארוכות ומורכבות יותר. בנוסף, אם תהליך יצירת האודיו נכשל או שהתיקייה יוצאת ריקה, הממשק פשוט זורק שגיאה כללית.

שאלות
נפוצות

האם השימוש בממשק הזה עולה כסף?

הגישה להדגמה באתר היא בחינם. עם זאת, המרחב עצמו נמצא כרגע במצב מושהה ולא רץ. אם תרצו להפעיל אותו בעצמכם על חומרה ייעודית, תצטרכו לשאת בעלויות המשאבים.

כמה זמן לוקח לייצר שיר שלם?

היצירה דורשת עיבוד כבד של כמה מודלים במקביל, כולל מודל שפה ומקודד אודיו. בגלל שמדובר בכרטיס A10G ובמגבלה של עד 3000 טוקנים, התהליך עשוי לקחת מספר דקות לכל שיר. אם השרת היה כבוי, יש להוסיף לזה זמן טעינה ראשוני.

האם אפשר להריץ את זה על המחשב בבית?

הקוד מבוסס על מודלים פתוחים שזמינים להורדה, כך שזה אפשרי טכנית. בפועל אתם חייבים כרטיס מסך חזק עם מספיק זיכרון כדי להחזיק מודל של שבעה מיליארד פרמטרים ומודלים נוספים במקביל. ללא חומרה ייעודית, ההרצה המקומית תהיה איטית מאוד או תיכשל מחוסר זיכרון.

מה ההבדל בין האפליקציה הזאת לבין המודל המקורי?

האפליקציה עוטפת את המודלים בממשק גרפי פשוט שמאפשר להזין טקסט ולקבל קובץ שמע ישירות לדפדפן. המודל המקורי דורש הרצה דרך שורת פקודה, הגדרת סביבת פיתוח והתקנת תלויות. כאן מקבלים פשטות, אבל מאבדים שליטה על חלק מהפרמטרים כמו מספר המקטעים שנעול בממשק.

איך משתמשים

בוחרים דוגמה או מקלידים ז'אנר ומילים, מכוונים את כמות הטוקנים בין 500 ל־3000 בעזרת הסליידר, ולוחצים על כפתור השליחה. מספר המקטעים קבוע מראש על שניים ולא ניתן לשינוי. החומרה שהוגדרה להרצה היא כרטיס A10G במתכונת זירו, מה שאומר שאם השרת קר הוא צריך להידלק ולהוריד משקלים כבדים, וזה יכול לקחת לא מעט זמן.

הרישיון

הרישיון לא דווח במאגר. המשמעות היא שאין הגדרה ברורה לגבי שימוש מסחרי בשירים שנוצרים או לגבי זכויות היוצרים על הפלטים, ולכן לא מומלץ להסתמך על התוצרים לפרויקטים מסחריים.

הרישיון המלא ב־Hugging Face ↗