GPT
P

parakeet-tdt_ctc-110m

קוד פתוח

nvidiacc-by-4.02024-09-17

  • nemo
  • automatic-speech-recognition
  • speech
  • audio
  • Transducer

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל תמלול מהיר במיוחד באנגלית, ששוקל פחות מחצי גיגה וכולל פיסוק ואותיות גדולות. הוא מיועד למי שרוצה לתמלל קבצים שלמים מקומית בלי לטחון משאבים.

  • 438 MBמשקל הקבצים
  • 2,573הורדות בחודש
  • 53לייקים

מה זה

מדובר במודל זיהוי דיבור קל משקל של כ־114 מיליון פרמטרים, שפותח במשותף על ידי אנבידיה ו־Suno.ai. המודל בנוי על ארכיטקטורת FastConformer היברידית שתומכת בפענוח מסוג TDT או CTC, ויודע לקבל קובצי אודיו במונו של 16 קילו-הרץ ולפלוט טקסט מתומלל עם אותיות גדולות וסימני פיסוק.

היתרון המרכזי כאן הוא שילוב של מנגנון full attention עם כיווץ משמעותי, שמאפשר לתמלל קטעים של עד 20 דקות בריצה אחת. אנבידיה מדווחת על קצב עיבוד של פי 5,300 מזמן אמת על כרטיס A100. מבחינת דיוק, הוא אומן על 36,000 שעות דיבור ומגיע ל־2.4% שגיאות מילים בבדיקות נקיות, אבל מטפס לכיוון 12% עד 15% בהקלטות מורכבות יותר כמו שיחות ופגישות.

מתאים ל

  • תמלול פודקאסטים באנגלית

    מאפשר לעבד קבצים ארוכים של עד 20 דקות בבת אחת, ומוציא טקסט שכבר כולל אותיות גדולות ופיסוק.

  • עיבוד מקומי של שיחות

    משקל קטן של 438 מגה מאפשר להריץ אותו על שרת פנימי זול בלי להוציא הקלטות רגישות החוצה.

  • אינדוקס כמויות קול גדולות

    קצב התמלול הגבוה מאפשר לעבור על אלפי שעות מוקלטות במהירות כדי לחפש מילות מפתח.

איפה זה נופל

החיסרון הברור ביותר לישראלים הוא השפה, המודל מאומן אך ורק על אנגלית ואינו תומך בעברית בכלל. בנוסף, המספרים מראים ירידה מורגשת בדיוק כשההקלטה מתרחקת מתנאי אולפן. במבחני שיחות מרובות דוברים ודיוני חברות שיעור השגיאות קופץ לאזור ה־16 אחוז, כך שהקלטות באיכות נמוכה או שיחות זום ידרשו בדיקה קפדנית.

שאלות
נפוצות

האם אפשר לתמלל איתו עברית?

לא. המודל מאומן על אנגלית בלבד ומכיל טוקנייזר של אותיות לטיניות וסימני פיסוק. ניסיון להזין לו דיבור בעברית יפיק ג'יבריש או פלט ריק.

האם המודל נתמך כבר ב־NVIDIA Riva?

לפי כרטיס המודל, הגרסה הספציפית הזו עדיין אינה נתמכת ישירות בתוך סביבת Riva. ההרצה נעשית ישירות דרך ספריית NeMo בקוד פייתון.

איזה קלט אודיו המודל דורש?

הוא מקבל קובצי wav בערוץ בודד בלבד (מונו) עם קצב דגימה של 16,000 הרץ. קבצים בסטריאו או בקצבי דגימה אחרים יש להמיר לפני השליחה.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית nemo_toolkit של אנבידיה ואת PyTorch. הקריאה עצמה בקוד פשוטה מאוד ודורשת שלוש שורות של טעינת המודל וקריאה לפונקציית התמלול. המודל מגיע במשקל כולל של 438 מגה-בייט, כך שהוא לא דורש שרת ענק ויכול לרוץ בקלות גם על מעבדים גרפיים צנועים יחסית.

ברירת המחדל משתמשת במפענח TDT, אך אפשר להגדיר שימוש ב־CTC. אם כל מה שאתם צריכים זה לתמלל כמה קבצים בודדים פעם בחודש, אין סיבה להסתבך עם התקנת התלויות הכבדות של NeMo, ועדיף להשתמש ב־API קיים. התקנה מקומית משתלמת רק כשרוצים לעבד כמויות גדולות בלי עלות לפי דקה.

pip install -U huggingface_hub
hf download nvidia/parakeet-tdt_ctc-110m

הקבצים

3 קבצים במאגר, 438 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי והפצה של המודל ושל תוצריו. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים המקוריים וציון הרישיון, כך שאין מניעה חוקית לשלב אותו בתוך מוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗