GPT
R

RE-USE

קוד פתוח

nvidiaother2026-03-17

  • mamba-ssm
  • safetensors
  • speech-enhancement
  • universal speech enhancement
  • multiple input sampling rates

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל קטן במיוחד של אנבידיה לניקוי ושיפור דיבור מלוכלך. הוא שוקל פחות מארבעים מגהבייט, מתמודד עם מגוון בעיות שמע, ושומר על מאפייני הדובר המקוריים.

  • 10Mפרמטרים
  • 37.7 MBמשקל הקבצים
  • 11,256הורדות בחודש
  • 103לייקים

מה זה

מדובר במודל שמע מסוג audio-to-audio בגודל 9.6 מיליון פרמטרים בלבד, שמתמקד בשיפור דיבור בתנאים קשים. המטרה שלו היא לא רק להשתיק רעשי רקע, אלא להתמודד עם מגוון בעיות שמע במקביל: הדהוד, עיוותי קטימה (clipping), דחיסת קודקים, איבוד פקטים ברשת, מיקרופונים ירודים והרחבת רוחב פס (bandwidth extension).

הוא מקבל קובצי wav בערוץ בודד במגוון תדרי דגימה מ־8 קילוהרץ ועד 48 קילוהרץ, ופולט קובץ נקי באותו טווח. הארכיטקטורה משלבת מקודד ומפענח קונבולוציה עם מודל מצבים Mamba דו-כיווני בעל שלושים שכבות, שנועד למדל זמן ותדר ביעילות גבוהה בלי צוואר הבקבוק החישובי של טרנספורמרים רגילים על רצפים ארוכים.

האימון נעשה על פחות מעשרת אלפים שעות דיבור ורעש, כולל נתוני דיבור באנגלית, גרמנית, ספרדית, צרפתית ומנדרינית. לפי התיעוד הוא מיועד לתפקד בצורה אגנוסטית לשפה, תוך שמירה על זהות הדובר, הרגש והמבטא ללא עיוותים מלאכותיים בתוכן הנאמר.

מתאים ל

  • ניקוי הקלטות קול ישנות

    מטפל במיקרופונים גרועים וברוחב פס נמוך, ויודע לבצע הרחבת תדרים לקבצי 8kHz ישנים.

  • עיבוד מקדים למודלי תמלול

    מסיר רעשי רקע, הדהוד ועיוותי דחיסה כדי להגיש אות דיבור נקי יותר למנועי זיהוי דיבור.

  • מחקר ארכיטקטורות Mamba בשמע

    בסיס לבחינת שכבות Mamba דו-כיווניות על שמע בתקציב זיכרון זעיר של עשרה מיליון פרמטרים.

איפה זה נופל

היוצרים מצהירים במפורש שהמודל מיועד למחקר ופיתוח בלבד, ולא לשימוש מבצעי. המשקל ששוחרר שונה מזה שמתואר במאמר המקורי, הוא אומן מחדש וכוונן על תת-קבוצה נקייה וקטנה יותר יחד עם עיוותים נוספים, ולכן תוצאות המאמר אינן משקפות אותו אחד לאחד.

בנוסף, קובצי אודיו ארוכים עלולים לקרוס בגלל חוסר בזיכרון GPU אלא אם מריצים אותם דרך מנגנון החלוקה למקטעים. מעבר לכך, נתוני האימון כללו בעיקר אנגלית ומספר שפות אירופיות ואסייתיות. עברית אינה מופיעה ברשימת המאגרים, ולכן איכות שימור הפונמות המקומיות והעיצורים הגרוניים דורשת בדיקה יסודית לפני שמסתמכים עליו.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה במוצר מסחרי?

לא. הרישיון של אנבידיה קובע מפורשות שמדובר ברישיון לא-מסחרי חד-כיווני (NSCLv1). השימוש מותר לצורכי מחקר ופיתוח פנימיים בלבד, כך שלא ניתן לבנות עליו שירות בתשלום או להפיץ אותו בתוך אפליקציה מסחרית.

איך מתמודדים עם שגיאות זיכרון בקובצי שמע ארוכים?

עבור קבצים ארוכים היוצרים מספקים סקריפט ייעודי בשם inference_chunk.sh. הסקריפט מחלק את האודיו למקטעים לפי פרמטרים שניתן להגדיר ידנית, כמו אורך מקטע ואחוז החפיפה, וכך נמנעת קריסת זיכרון במאיץ.

האם המודל תומך בעברית למרות שלא אומן עליה ישירות?

הכרטיס מגדיר את המודל כבעל יכולת אגנוסטית לשפה, שנועדה לשמר את מאפייני הדובר בלי תלות בשפת הדיבור. עם זאת, מערכי הנתונים כללו אנגלית, גרמנית, ספרדית, צרפתית ומנדרינית בלבד. כדי לדעת אם פונמות בעברית לא נבלעות או מתעוותות בסינון, חובה לבדוק דגימות מקומיות בעצמכם.

איך מריצים

המשקל הכולל של הקבצים עומד על 37.7 מגהבייט, כך שהוא נכנס בקלות לכל זיכרון קיים, אבל תלויות ההרצה דורשות תשומת לב. הבסיס נשען על ספריית mamba-ssm וסביבת לינוקס. אנבידיה מציעה להשתמש באימג' דוקר מוכן של SEMamba כדי לחסוך את כאב הראש שבהתקנת הידור הקרנלים של Mamba עבור CUDA.

החומרה שנבדקה רשמית היא אנבידיה Ampere A100, אם כי מודל בגודל 10M פרמטרים אמור לרוץ בקלות על מאיצים קטנים בהרבה. ההרצה מתבצעת דרך סקריפטים ב־bash: קבצים קצרים מועברים ישירות לסקריפט inference רגיל, ועבור קבצים ארוכים שמסכנים את הזיכרון בעומס יש סקריפט ייעודי שמפרק את האודיו למקטעים (chunks). להרחבת תדרים יש להתקין גם את חבילת resampy.

pip install -U huggingface_hub
hf download nvidia/RE-USE

הרישיון

המודל שוחרר תחת רישיון NVIDIA One-Way Noncommercial License (NSCLv1). הרישיון הזה אוסר כל שימוש מסחרי, ומתיר פעילות מחקר ופיתוח בלבד. אם יש לכם כוונה לשלב אותו במוצר, להפיץ אותו ללקוחות או לייצר ממנו הכנסה, תצטרכו לחפש חלופה בקוד פתוח מתירני.

הרישיון המלא בעמוד המודל ↗