GPT
O

OpenMusic

רץ בדפדפן

jadechoghariרישיון לא דווח2024-09-21

  • gradio

הדגמה שמייצרת קטעי מוזיקה מתוך תיאור טקסטואלי חופשי באנגלית. היא פונה למי שמחפש סקיצות שמע מהירות בלי לגעת בכלי עריכה.

  • הורדות בחודש
  • 214לייקים

מה זה

אתם מקלידים בתיבת הטקסט תיאור של סגנון, כלים או אווירה מוזיקלית שאתם רוצים לשמוע. הקוד לוקח את התיאור שלכם, מוסיף לו אוטומטית מקדימה את המילים high quality כדי לכוון את הפלט, ומעביר אותו לעיבוד.

מאחורי הקלעים רץ תהליך דיפוזיה דרך צינור שנקרא MOSDiffusionPipeline יחד עם המודל jadechoghari/openmusic. ברשימת התלויות של הדף מופיעים גם מודלים מוכרים כמו bart-base, flan-t5-large ורכיבי שפה נוספים שקשורים לניתוח הטקסט והפילטרים שלו. בסוף התהליך הממשק פולט נגן אודיו פשוט להאזנה ולהורדה של קובץ השמע שנוצר, וכולל דוגמאות מובנות להרצה בטעינה עצלה כדי לבדוק איך הוא מגיב לבקשות שונות בלי להקליד מאפס.

מתאים ל

  • בדיקת כתיבת פרומפטים

    התנסות בניסוחי טקסט כדי לראות איך מודל דיפוזיה פתוח מפרש סגנונות וכלי נגינה שונים.

  • יצירת סקיצות שמע

    הפקת רעיונות מוזיקליים קצרים ובדיקת כיווני אווירה לפני שמתחילים להקליט או לערוך באמת.

  • לימוד קוד ההטמעה

    מעבר על קובץ app.py כדי לראות איך מחברים את צינור MOSDiffusionPipeline לממשק משתמש.

איפה זה נופל

הבעיה הגדולה ביותר היא שהאפליקציה בכלל לא נבנית בהצלחה כרגע. מעבר לזה, המנגנון פשוט מדביק את הביטוי high quality לטקסט שלכם בלי לשאול אתכם, כך שאין לכם שליטה אמיתית על פרמטרים טכניים כמו קצב, אורך הקטע, או כוונון עדין של הכלים. מי שמצפה להפקה מוזיקלית מלאה ונקייה יגלה שדיפוזיה על מעבד פשוט ללא האצת חומרה מתאימה מייצרת לרוב פשרות באיכות או זמני המתנה בלתי נסבלים.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה כרגע בחינם בדפדפן?

השימוש עקרונית חופשי, אבל כרגע האפליקציה תקועה במצב BUILD_ERROR. זה אומר שהיא לא עולה בדפדפן בכלל עד שהמפתח יתקן את שגיאות ההרצה שלה.

האם אפשר להריץ את המערכת הזו מקומית על המחשב?

כן, הקוד הציבורי נשען על ספריית gradio וצינור MOSDiffusionPipeline. תצטרכו להוריד את הקבצים, להתקין את הספריות המתאימות, ועדיף שיהיה לכם כרטיס מסך ייעודי כדי שלא תיתקעו שעות מול המעבד.

מה קורה עם הטקסט שמקלידים בחלון?

הטקסט נשלח ישירות לסקריפט שרץ בשרת של Hugging Face כדי לחולל את השמע. לא מדווח כאן שום מנגנון שמירת נתונים מיוחד, אך המידע עובר דרך התשתית הציבורית של הפלטפורמה.

במה האפליקציה הזאת שונה מהרצת המודל ישירות בקוד?

היא מציגה מעטפת גרפית פשוטה שמקבלת שורת טקסט ומחזירה נגן שמע. ההבדל המרכזי בקוד הוא שהיא מוסיפה אוטומטית את המילים high quality לפני כל בקשה שאתם מקלידים, בלי אפשרות לכוונן שאר משתנים.

איך משתמשים

נכנסים לעמוד, כותבים תיאור של שתי שורות בתיבת הטקסט או בוחרים דוגמה מוכנה ולוחצים להרצה. אין כאן דרישת הרשמה מיוחדת מעבר לכניסה רגילה, אבל המרחב מוגדר על חומרת cpu-basic בסיסית. זה אומר שיצירת גלי הקול עלולה לקחת זמן ארוך מאוד, ובפועל העמוד תקוע כרגע על שגיאת בנייה BUILD_ERROR, כך שאי אפשר להריץ אותו ישירות בדפדפן עד שמי שבנה אותו יתקן את ההתקנה.

הרישיון

הרישיון של המרחב לא דווח כלל במאגר. במצב כזה אין אישור מפורש לשימוש מסחרי בקבצים שנוצרים או בקוד עצמו. אם אתם מתכננים לשלב את השמע בפרויקט פומבי או עסקי, קחו בחשבון שהזכויות וההגבלות על התוצר אינן מוגדרות.

הרישיון המלא ב־Hugging Face ↗