GPT
B

BigVGAN

רץ בדפדפן

nvidiamit2024-07-13

  • gradio
  • mcp-server

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הכלי מציג יכולות של ווקודר עצבי להמרת ספקטרוגרמות חזרה לצליל נקי. הוא מיועד למי שרוצה לבדוק שחזור אודיו ומוזיקה לפני הטמעה בקוד.

  • הורדות בחודש
  • 114לייקים

מה זה

אתם מעלים קובץ אודיו או בוחרים דוגמה קיימת, והקוד מחשב ספקטרוגרמת מל ומנסה לשחזר ממנה את גל הקול המקורי. הפלט כולל נגן לשמיעת התוצאה לצד תמונה שמציגה את הספקטרוגרמה שנוצרה בדרך.

מאחורי הקלעים רצות גרסאות של BigVGAN ושל BigVGAN-v2 של אנבידיה. בממשק יש רשימת מודלים שנטענים מראש לבחירה מתוך תפריט נפתח, כך שאפשר להשוות בין גרסאות שונות על אותו קטע שמע.

הדוגמאות המובנות מכילות קטעי דיבור ממאגרים כמו LibriTTS ודגימות בקצבים של 24kHz ועד 44kHz, לצד קטעי מוזיקה מוכרים כמו קווין, מגלובניה ודגימות מתוך MusDB ו־MusicCaps.

מתאים ל

  • בדיקת איכות שחזור קול

    בוחנים איך המודל משחזר דיבור אנושי מתוך ייצוג תדרים בקצבי דגימה של 24 ו־44 קילו-הרץ.

  • שחזור קטעי מוזיקה מורכבים

    בודקים עמידות של ווקודר על רצועות שירים עמוסות בכלי נגינה וקולות שונים.

  • השוואה בין גרסאות מודל

    מריצים את אותו קטע מול גרסאות שונות של BigVGAN כדי לשמוע הבדלי צליל וארטיפקטים.

איפה זה נופל

זה לא כלי לשיפור או ניקוי הקלטות פגומות. הוא לוקח שמע תקין, מפרק אותו לייצוג תדרים ובונה אותו מחדש, כך שאם תעלו קובץ באיכות גרועה תקבלו שחזור של אותה איכות בדיוק. הדוגמאות אינן נשמרות במטמון לפי הגדרות הקוד, ולכן כל הרצה דורשת חישוב מחדש.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, הגישה לממשק פתוחה בחינם לגמרי בדפדפן. החישוב מתבצע על שרתי הענן שמארחים את העמוד ללא צורך בהזנת אמצעי תשלום. אתם רק נכנסים ומעלים קובץ לבדיקה.

כמה זמן לוקח לכל קובץ להתעבד?

העיבוד עצמו קצר מאוד תודות למאיץ A10G שמוגדר בפרויקט. עם זאת, בגלל השימוש במנגנון הקצאה דינמי, ייתכן שתחכו כמה שניות לתור אם יש משתמשים נוספים באותו רגע.

האם אפשר להריץ את זה על המחשב שלי?

כן, הקוד משתמש בספריית bigvgan הפתוחה שניתן להתקין בסביבת פייתון מקומית. כדי להריץ אותה ביעילות בבית תצטרכו כרטיס מסך מתאים של אנבידיה וספריות תואמות של PyTorch.

במה הממשק הזה שונה מהמודל המלא?

הממשק מדגים רק פעולה אחת ספציפית של פירוק האודיו לספקטרוגרמה ובנייתו מחדש. במערכות שלמות המודל משמש שלב סופי שמחבר טקסט לדיבור, ולא כלי עצמאי להאזנה דרך הדפדפן.

איך משתמשים

בוחרים מודל מהתפריט הנפתח, מעלים קובץ שמע לתיבת הקלט ולוחצים על Submit. אם לא תעלו אודיו, הממשק יקפיץ שגיאה שמבקשת קובץ.

העיבוד רץ על מאיץ גרפי ייעודי מסוג Zero-A10G דרך ספריית spaces. זה אומר שהחישוב מתבצע במהירות של חומרה חזקה, אבל בזמני עומס ייתכן שתמתינו להקצאת משאבים.

הרישיון

הפרויקט מפורסם תחת רישיון MIT. מדובר ברישיון קוד פתוח מתירני שמאפשר שימוש חופשי, העתקה והתאמה של הקוד, אך אין מידע בקוד על שמירה או מחיקה של קבצי שמע שאתם מעלים לממשק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗