GPT
N

NVIDIA-NemotronLabs-VoiceChat-11B

קוד פתוח

nvidiaopenmdw-1.12026-07-29

  • safetensors
  • en

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל שיחה קולית מקצה לקצה שמדבר, מקשיב ומפעיל כלים במקביל בלי שרשור של מודלים נפרדים. הוא מגיב תוך כחצי שנייה ומאפשר למשתמש להתפרץ לדבריו באופן טבעי.

  • 11Bפרמטרים
  • 41.3 GBמשקל הקבצים
  • 3,698הורדות בחודש
  • 465לייקים

מה זה

במקום לחבר זיהוי קולי, מודל שפה ומנוע דיבור בנפרד, המודל הזה מאחד את כל התהליך ברשת אחת. הארכיטקטורה משלבת מקודד קול Fast Conformer, מודל שפה Nemotron Nano v2 בגודל תשעה מיליארד פרמטרים שמבוסס על שילוב Mamba וטרנספורמר, ומפענח דיבור ייעודי. התוצאה היא שיחה רציפה שבה אפשר לקטוע אותו באמצע משפט, והוא עוצר ומגיב מיד עם שיהוי של כ־450 מילישניות.

החידוש העיקרי כאן מול פתרונות קודמים הוא תמיכה בהפעלת כלים תוך כדי דיבור. בזמן שהמערכת ממתינה לתשובה מה־API החיצוני, היא מסוגלת להשמיע הודעת המתנה מוגדרת מראש כדי לא לקטוע את שטף הדיבור. במבחני ביצועים למודלים קוליים פתוחים הוא מדורג שני, ומציג דיוק של 82.5 אחוזים בבחירת הכלי הנכון, אם כי הדיוק בהעברת הפרמטרים נמוך משמעותית ועומד על 42.2 אחוז בלבד.

מתאים ל

  • מוקד שירות קולי באנגלית

    זמן התגובה הקצר והיכולת לקטוע את הסוכן מייצרים שיחה שוטפת שמרגישה כמו נציג אנושי.

  • סייען קולי המפעיל מערכות

    מאפשר להריץ פונקציות ברקע תוך כדי השמעת הודעות המתנה, בלי ליצור שתיקות מביכות בשיחה.

  • אימון וסימולציות קוליות

    המודל מקבל קול ומחזיר קול ישירות, מה שחוסך תקורת רשת וצימוד של שלוש מערכות נפרדות.

איפה זה נופל

המודל תומך כרגע בשפה האנגלית בלבד, ואינו מתאים לשימוש בעברית. בנוסף, קיימת דרישה קשיחה שכל הפרומפטים ותשובות הכלים ייכתבו בתווי ASCII פשוטים בלבד, ללא תווים מיוחדים או אימוג'ים, כדי לא לשבור את מפענח הקול. החיסרון הבולט ביותר הוא דיוק העברת הפרמטרים לכלים, שעומד על 42.2 אחוז בלבד, עם ציון מעבר של 33 אחוז ב־Pass@1. במערכות שדורשות דיוק מוחלט בשליפת נתונים, המודל עלול לטעות לעיתים קרובות בהרכבת הקריאה.

שאלות
נפוצות

האם המודל מסוגל לנהל שיחה בעברית?

לא. המודל אומן על אנגלית בלבד והפלט הקולי שלו מותאם לשפה זו. ניסיון להזין קלט בעברית או טקסט שאינו ASCII יפגע בפעולת המפענח.

האם אפשר להריץ אותו על כרטיס מסך ביתי רגיל?

הקבצים שוקלים מעל 41 גיגה-בייט והארכיטקטורה דורשת חומרה ייעודית של אנבידיה כמו A100 או RTX-6000. כרטיסים צרכניים פשוטים לא יכילו את המודל בזיכרון.

איך המודל מתמודד עם זמני המתנה של קריאות API?

הארכיטקטורה מאפשרת להגדיר הודעת ביניים קולית שהסוכן אומר ברגע שהקריאה יוצאת לדרך, כך שהמשתמש לא נשאר בדממה עד לקבלת התשובה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־41.3 גיגה-בייט, ונבדק רשמית על מעבדי אנבידיה מסדרות A100, H100, H200, B100, B200 ו־RTX-6000 תחת לינוקס. מנוע ההרצה מבוסס vLLM, ויש שתי דרכים להשתמש בו. לבדיקות מהירות מריצים סקריפט פייתון להסקה מקומית בקבצי אודיו דרך ענף ייעודי במאגר NeMo Speech, אבל לשיחה אמיתית צריך לפרוס קונטיינר ייעודי שפותח תקשורת WebSocket דו-כיוונית ומנצל את Triton.

אם אין לכם גישה לכרטיס שרת עם זיכרון וידאו של 40 או 80 גיגה לפחות, אין טעם לנסות להרים אותו על מחשב מקומי. במקרה כזה, עדיף להשתמש בממשקי ענן שמספקים שירותי דיבור מקצה לקצה.

pip install -U huggingface_hub
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B

הרישיון

המודל מופץ תחת רישיון openmdw-1.1. יש לקרוא בעיון את תנאי ההסכם הרשמיים במאגר של OpenMDW כדי לוודא עמידה בהגבלות השימוש המסחרי וההפצה לפני שילוב שלו במוצרים פעילים.

הרישיון המלא בעמוד המודל ↗