GPT
N

nemotron-speech-streaming-en-0.6b

קוד פתוח

nvidiaother2025-12-17

  • nemo
  • safetensors
  • gguf
  • nemotron_asr_streaming
  • feature-extraction

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

תמלול באנגלית בזמן אמת עם שיהוי נמוך ובלי חישובים כפולים. הוא מתאים למי שבונה סוכני קול או מערכות תמלול חי שחייבות לעבוד עם נתחי שמע קצרים.

  • 618Mפרמטרים
  • 5.3 GBמשקל הקבצים
  • 268,142הורדות בחודש
  • 620לייקים

מה זה

בבסיס שלו יושבת ארכיטקטורת FastConformer עם מפענח RNN-T בגודל 618 מיליון פרמטרים. במקום לעבוד בשיטה הרגילה של חלונות שמע חופפים שדורשים לחשב מחדש מידע שכבר עבר, הוא שומר זיכרון מטמון של שכבות הקידוד ומעבד רק את מקטע האודיו החדש שנכנס. זה מאפשר לו להריץ תעבורת סטרימינג גבוהה בהרבה על אותו כרטיס גרפי.

הוא אומן על מעל 530,000 שעות שמע באנגלית אמריקאית, וכולל בתוכו פיסוק ואותיות גדולות ללא צורך במודל נפרד. במבחני שיעור שגיאות מילים במערכי בדיקה מקובלים, הוא עומד על ממוצע של 6.93 אחוז שגיאה כשמזרימים נתחים של 1.12 שניות, ועולה מעט ל־7.07 אחוז שגיאה כשמורידים את החלון ל־0.56 שניות. המשמעות היא שאפשר לקצר את השיהוי לטובת חוויית שיחה חלקה בלי לשלם כמעט באיכות התמלול.

מתאים ל

  • סוכני שיחה קוליים

    חלון עיבוד של 80 עד 160 מילישניות נותן תגובה כמעט מיידית בדיבור אנגלי שוטף.

  • כתוביות חיות לשידורים

    תמיכה מובנית בפיסוק ואותיות גדולות מייצרת טקסט קריא בלי מודל עריכה נוסף ברקע.

  • שירותי תמלול עתירי נפח

    מנגנון המטמון חוסך כפל חישובים ומאפשר להריץ יותר ערוצים מקבילים על אותו מעבד גרפי.

איפה זה נופל

הוא מוגבל אך ורק לאנגלית, כך שלעברית או שפות אחרות הוא לא רלוונטי בכלל. איכות התמלול יורדת משמעותית בסביבות מורכבות: בעוד שבהקלטות נקיות אחוז השגיאה עומד על 2.32, בשיחות ועידה אמיתיות ובדיונים פיננסיים כמו AMI ו־Earnings22 הוא מזנק ל־11.73 ו־12.52 אחוז. בנוסף, חובה להזין לו קובצי מונו בלבד, ואם השמע לא נקי מרעשי רקע קיצוניים תראו ירידה מורגשת בדיוק.

שאלות
נפוצות

האם אפשר לתמלל איתו שיחות בעברית?

לא. המודל אומן רק על אנגלית, בעיקר במבטא אמריקאי, ואינו תומך בעברית כלל.

איך בוחרים בין שיהוי נמוך לדיוק גבוה?

השליטה נעשית בהגדרות הריצה דרך גודל הנתח, בלי צורך באימון מחדש. נתח של 80 מילישניות נותן שיהוי מינימלי, בעוד נתח של 1120 מילישניות מספק את רמת הדיוק הגבוהה ביותר.

האם חייבים כרטיס של אנבידיה כדי להריץ אותו?

להרצה מקומית מלאה ב־NeMo יש יתרון ברור לחומרת אנבידיה בזכות אופטימיזציות CUDA. יחד עם זאת, אפשר להשתמש בקובץ ה־GGUF דרך מנוע C++ או לחלופין לצרוך אותו כשירות ענן דרך ה־API של החברה.

איך מריצים

המודל שוקל 5.3 גיגהבייט ודורש תמיכה של ספריית NeMo, אם כי גרסאות חדשות של Transformers מריצות אותו גם כן. להרצה מקומית קלה בלי התקנות כבדות קיים קובץ GGUF ייעודי שמריצים ישירות עם כלי C++ כמו NeMo-Speech.cpp. כרטיס מסך בודד עם זיכרון סביר יחזיק אותו בלי בעיה לתמלול חי, במיוחד כשהקלט הוא ערוץ מונו בודד.

אפשר לבחור את גודל הנתח בזמן ריצה, מ־80 מילישניות ועד 1120 מילישניות, לפי הצורך בשיהוי מול דיוק. למי שאין כרטיס גרפי של אנבידיה זמין או שבונה אבטיפוס מהיר, עדיף לקרוא ל־API המנוהל שלהם ב־NIM דרך ספריית הלקוח של Riva במקום להרים סביבת תלויות שלמה.

ollama run hf.co/nvidia/nemotron-speech-streaming-en-0.6b:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

השימוש כפוף להסכם המודלים הפתוחים של אנבידיה, תחת רישיון שמוגדר other. הוא מתיר שימוש מסחרי ולא מסחרי, אך כולל תנאים משפטיים ייעודיים של החברה שחשוב לבדוק לפני שמפיצים אותו כחלק ממוצר עצמאי.

הרישיון המלא בעמוד המודל ↗