GPT
A

Audio-SR

רץ בדפדפן

Nick088mit2024-05-11

  • gradio

הכלי מיועד למי שרוצה לשפר איכות של קבצי שמע ישנים או מטושטשים באמצעות הרחבת תדרים. אתם מעלים קובץ שמע ומקבלים גרסה משוחזרת בטכנולוגיית סופר רזולוציה.

  • הורדות בחודש
  • 81לייקים

מה זה

מעלים קובץ קול דרך ממשק הרשת, בוחרים בין מודל כללי לבין מודל ייעודי לדיבור, ומקבלים קובץ שמע משודרג שמחושב ישירות בזיכרון. הממשק נותן לשחק עם כמות צעדי הדגימה של DDIM, ערך הסיד לשחזור מדויק, ומקדם ההנחיה שקובע כמה השחזור ייצמד להקשר.

מאחורי הקלעים רץ הקוד של AudioSR יחד עם מודלים של עיבוד שפה ושמע, בהם מודלים מסוג audiosr_basic ו־audiosr_speech, לצד ספריות תומכות ממשפחת bert ו־roberta. הקוד מחשב באופן דינמי את זמן השימוש במעבד הגרפי כדי לחסוך במכסה, אך בעמוד אין דוגמאות מובנות להאזנה לפני שמעלים קובץ עצמאי.

מתאים ל

  • שחזור הקלטות דיבור

    שימוש במודל הדיבור הייעודי לצורך חידוד קולות אנושיים והרחבת טווח התדרים של שיחות מוקלטות.

  • העלאת איכות דגימות סאונד

    הרצת צלילים ומוזיקה כללית דרך המודל הבסיסי כדי לבדוק שחזור של תדרים גבוהים שאבדו בדחיסה.

  • בדיקת פרמטרים של דיפוזיה

    השוואה בין רמות שונות של צעדי DDIM כדי למצוא את האיזון בין זמן עיבוד לרמת פירוט בשמע.

איפה זה נופל

נכון לעכשיו המרחב נמצא במצב של שגיאת הגדרה, כך שהוא אינו פועל ישירות בדפדפן ולא יפיק תוצאות עד שהמפתח יתקן את הקוד. בנוסף, מי שבונה על שחזור צליל שבור לחלוטין יגלה שמודלי דיפוזיה כאלה יכולים להוסיף רעשים או עיוותים אם מגדירים יותר מדי צעדי דגימה.

שאלות
נפוצות

האם הכלי זמין לעבודה עכשיו?

לא. המרחב מדווח כרגע על שגיאת קונפיגורציה שמונעת ממנו לעלות באופן תקין. תצטרכו להמתין לעדכון או להוריד את הקוד ולהריץ אותו בסביבה משלכם.

האם השירות עולה כסף?

לא, השימוש בדף עצמו הוא בחינם ומבוסס על משאבי ZeroGPU שמספק השרת. הרישיון של הפרויקט הוא רישיון קוד פתוח מסוג MIT.

מה ההבדל בין מודל basic למודל speech בממשק?

המודל הבסיסי מיועד לכל סוג של צליל כולל אפקטים ומוזיקה. מודל הדיבור אומן ספציפית על קול אנושי כדי לשמור על מובנות המילים ולמנוע עיוותים בדיבור.

האם אפשר להריץ את זה על המחשב?

כן, הקוד מבוסס על ספריות פייתון סטנדרטיות כמו gradio ו־torch. תוכלו לקחת את המאגר ולהריץ אותו מקומית, בתנאי שיש לכם כרטיס מסך מתאים וזיכרון מספק.

איך משתמשים

טוענים קובץ לממשק, קובעים את הערכים בסליידרים ולוחצים על כפתור ההרצה כדי לייצר את השמע. הכלי מוגדר לרוץ על חומרת Zero A10G דרך ספריית spaces, מה שמבטיח עיבוד מהיר ברגע שיש גישה למשאב הגרפי, ללא צורך בהתקנה מקומית או בהרשמה מסובכת.

הרישיון

הפרויקט מפורסם תחת רישיון MIT, שמאפשר שימוש חופשי, שינוי והפצה של הקוד. עם זאת, קבצי השמע שאתם מעלים עוברים דרך השרתים שמארחים את המרחב.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗