GPT
P

parakeet_realtime_eou_120m-v1

קוד פתוח

nvidiaother2025-10-10

  • nemo
  • speech-recognition
  • FastConformer
  • end-of-utterance
  • voice agent

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל תמלול מהיר במיוחד באנגלית שמסמן מתי הדובר סיים משפט. הוא מיועד למי שבונה סוכני קול וצריך תגובה מיידית בלי מנגנון שתיקה נפרד.

  • 439 MBמשקל הקבצים
  • 560הורדות בחודש
  • 152לייקים

מה זה

מדובר במודל זיהוי דיבור בהזרמה עם 120 מיליון פרמטרים, המבוסס על ארכיטקטורת FastConformer-RNNT עם 17 שכבות קידוד. הייחוד שלו מול מודלים קטנים אחרים הוא שילוב של תמלול רציף יחד עם זיהוי סוף משפט. במקום להמתין לשקט ממושך כדי להבין שהמשתמש סיים לדבר, המודל פולט טוקן ייעודי של סוף ביטוי תוך כדי הזרמת הטקסט, בהשהיה של 80 עד 160 מילישניות.

בבדיקות של אנבידיה הוא מציג שיעור שגיאות מילים ממוצע של 9.30% במבחני HuggingFace OpenASR. באודיו נקי כמו LibriSpeech המספרים טובים מאוד ומגיעים ל־3.61%, אבל בהקלטות מורכבות יותר מפגישות או שיחות ועידה כמו AMI ו־Earnings22 השגיאות עולות מעבר ל־15%. מבחינת זיהוי סוף דיבור, חצי מהמקרים מזוהים תוך 160 מילישניות, וב־95% מהמקרים הזיהוי לוקח עד 320 מילישניות.

מתאים ל

  • סוכני שיחה קוליים

    זיהוי סוף דיבור מהיר מאפשר לבוט להתחיל לענות כמעט בלי השהיה.

  • תמלול חי באנגלית

    הזרמת טקסט בהשהיה של 80 עד 160 מילישניות על חומרת שרת רגילה.

  • מערכות פקודות קוליות

    קליטת הוראות קצרות וחיתוך מיידי ברגע שהמשתמש סיים את הפקודה.

איפה זה נופל

הוא תומך אך ורק באנגלית, ואין לו שום תמיכה בעברית. הטקסט שהוא פולט מגיע ללא אותיות גדולות וללא סימני פיסוק כלל, כך שאם הפלט מיועד לקריאה אנושית תצטרכו להעביר אותו שלב עיבוד נוסף. מעבר לזה, זיהוי סוף המשפט נבדק בעיקר על דיבור סינתטי, כך שרעשי רקע ומבטאים בעולם האמיתי עלולים לשבש את התזמון ולגרום לו לחתוך את הדובר באמצע.

שאלות
נפוצות

האם המודל מתאים לזיהוי דיבור בעברית?

לא. המודל אומן ותומך בשפה האנגלית בלבד, ואינו כולל שפות אחרות.

האם הטקסט שיוצא כולל נקודות, פסיקים ואותיות גדולות?

לא. הפלט מגיע כמחרוזת נקייה מפיסוק ומאותיות גדולות, למעט הטוקן שמסמן סוף דיבור. לטקסט קריא יש להוסיף מודל פיסוק בנפרד.

אפשר להריץ אותו בלי כרטיס מסך של אנבידיה?

לא מומלץ. הארכיטקטורה והספרייה בנויות ישירות מעל CUDA ורצות על ארכיטקטורות GPU ספציפיות של אנבידיה.

איך מריצים

המודל דורש סביבת לינוקס עם ספריית NeMo בגרסה 2.5.3 ומעלה, ומותאם להרצה מעל מאיצי אנבידיה בארכיטקטורות Volta, Ampere, Hopper או Blackwell. הוא נבדק על כרטיסים כמו V100, A100 ו־A6000. בגלל המשקל הנמוך שלו, 439 מגה בייט בלבד, הוא לא דורש זיכרון וידאו מסיבי ויכול לרוץ בקלות על כרטיס בודד.

ההזנה חייבת להיות ערוץ שמע בודד ב־16 קילו הרץ, עם מקטעים של 160 מילישניות לפחות. אם אתם צריכים רק תמלול לא מקוון של קבצים שלמים, אין סיבה להתעסק עם ההתקנה של NeMo וההגדרות של הזרמה, ועדיף להשתמש במודלי תמלול רגילים או שירותי ענן.

pip install -U huggingface_hub
hf download nvidia/parakeet_realtime_eou_120m-v1

הקבצים

5 קבצים במאגר, 439 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת NVIDIA Open Model License ופתוח לשימוש מסחרי ולא מסחרי. מותר לשלב אותו במוצרים, אך השימוש כפוף לתנאי הרישיון המלאים של אנבידיה ויש לוודא עמידה בהם לפני הפצה.

הרישיון המלא בעמוד המודל ↗