GPT
B

bigvgan_v2_44khz_128band_512x

קוד פתוח

nvidiamit2024-07-15

  • PyTorch
  • neural-vocoder
  • audio-generation
  • audio-to-audio

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

ווקודר עצבי שממיר ספקטרוגרמות של מל לאודיו באיכות 44 קילוהרץ. הוא מיועד למי שצריך סינתזת קול או סאונד באיכות גבוהה ואינו מסתפק ברוחב הפס המקובל של 22 או 24 קילוהרץ.

  • 3.8 GBמשקל הקבצים
  • 614,019הורדות בחודש
  • 77לייקים

מה זה

מדובר בגרסה השנייה של BigVGAN מבית אנבידיה, שמחזירה גלי קול מתוך ייצוגי מל ספקטרוגרם. הדגם הספציפי הזה מכיל 122 מיליון פרמטרים ומכוון לעבודה בקצב דגימה של 44 קילוהרץ עם 128 ערוצי מל ויחס הגדלה של 512, מה שמאפשר לו לשחזר תדרים עד 22,050 הרץ. במקום להתמקד בדיבור בלבד כמו הגרסאות הקודמות שאומנו על מאגרי LibriTTS, הוא אומן במשך 5 מיליון צעדים על אוסף נתונים רחב הכולל דיבור בריבוי שפות, צלילי סביבה וכלי נגינה.

ההבדל המשמעותי בגרסה 2 נובע משילוב של מאמן מפלה מסוג תתי תדרים מרובי סקלות בשיטת CQT, יחד עם פונקציית הפסד ייעודית לספקטרוגרמות. המטרה של המבנה הזה היא לפתור בעיות צרימה ועיוותים שנפוצים בשחזור קבצים עשירי הרמוניות, במיוחד כשעולים לתדרי דגימה שמיועדים למוזיקה ולא רק לשיחות טלפון.

מתאים ל

  • שלב יציאה בסינתזת שירה

    איכות דגימה של 44 קילוהרץ מאפשרת להפיק שירה נקייה מתדרים קטומים שנפוצים במודלי דיבור רגילים.

  • הפקת אפקטים וצלילי סביבה

    האימון הרחב על כלי נגינה ורעשי סביבה מתאים לשחזור צלילים שאינם כוללים קול אנושי.

  • שכבת שמע למודלי טקסט לקול

    משמש כחוליה סופית שממירה את המל ספקטרוגרם של מודל הטקסט לקובץ שמע שמיע.

איפה זה נופל

זהו ווקודר בלבד ולא מערכת שלמה לייצור קול. הוא אינו מקבל טקסט ואינו יודע מה לעשות איתו, אלא רק ממיר מל ספקטרוגרם קיים לגל קול. אם הקלט שתזינו לו אינו תואם בדיוק לפרמטרים של 128 ערוצים ורוחב פס של 44 קילוהרץ, התוצאה תהיה רעש דיגיטלי בלתי שמיש. בנוסף, למרות שהאימון כולל צלילי סביבה וכלים, הדגם לא עבר כוונון עדין למשימה צרה ספציפית, כך ששחזור של שירה מורכבת או כלי נגינה ייחודיים עלול עדיין להישמע מתכתי ומחייב בדיקת שמע באוזניות מקצועיות לפני הטמעה.

שאלות
נפוצות

האם אפשר לתת למודל טקסט ולקבל קובץ שמע?

לא. המודל הוא ווקודר עצבי שתפקידו לקבל ייצוג תדרים קיים ולהפוך אותו לגל קול. כדי לקבל דיבור מטקסט, תצטרכו להריץ קודם מודל שממיר טקסט למל ספקטרוגרם, ורק אז להעביר את הפלט שלו ל־BigVGAN.

האם המודל יפעל במהירות סבירה על גבי מעבד רגיל?

הוא יפעל לאט מאוד. המודל מבוסס על קרנל מותאם שנבנה עבור מעבדי אנבידיה כדי לקבל ביצועים בזמן אמת, והרצה שלו על מעבד מרכזי בלבד אינה מתאימה למערכות שדורשות מענה מהיר.

איך מריצים

טוענים את המודל ישירות בפייתורץ' דרך הספרייה הייעודית, וכדי לקבל ביצועים סבירים מפעילים את הקרנל המותאם של CUDA. ההרצה הזו דורשת כרטיס גרפי של אנבידיה עם תמיכה ב־CUDA 12.1, ובפעם הראשונה היא מקמפלת קוד מקומי באמצעות nvcc ו־ninja. אנבידיה מדווחת שהקרנל המאוחד מאיץ את זמן ההסקה פי 1.5 עד פי 3 על גבי מעבד A100 יחיד.

אם אתם רצים ללא חומרת אנבידיה תואמת או עם גרסאות קומפיילר לא מתאימות, הקרנל לא יתקמפל ותישארו עם ביצועים נמוכים בהרבה. לעומת גרסאות ה־256x באוסף שמסתפקות ב־112 מיליון פרמטרים, הגרסה הזו כבדה יותר, ולכן אם אתם צריכים רק דיבור סטנדרטי בלי תדרים גבוהים, הגרסאות הקטנות של 22 קילוהרץ יחסכו לכם זיכרון יקר.

pip install -U huggingface_hub
hf download nvidia/bigvgan_v2_44khz_128band_512x

הרישיון

הקוד והמשקלים זמינים תחת רישיון MIT. מותר להשתמש בהם לכל מטרה, כולל מוצרים מסחריים סגורים ושינוי של הקוד, בלי לשלם תמלוגים לאנבידיה. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים ונוסח הרישיון המקורי בקבצי הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗