GPT
P

parakeet-tdt-1.1b

קוד פתוח

nvidiacc-by-4.02024-01-25

  • nemo
  • automatic-speech-recognition
  • speech
  • audio
  • Transducer

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל תמלול אנגלית שמיועד לעיבוד מהיר במיוחד בזכות חיזוי מקבילי של אותיות ומשכי זמן. הוא מתאים למי שחייב תמלול מדויק בלי לחכות לשניות ארוכות של פענוח.

  • 4.0 GBמשקל הקבצים
  • 2,587הורדות בחודש
  • 137לייקים

מה זה

המודל פותח בשיתוף פעולה בין אנבידיה לבין הצוות של Suno, והוא מבוסס על שילוב של ארכיטקטורת FastConformer יחד עם TDT, מנגנון שמנבא תו ומשך זמן בו זמנית ומדלג על פריימים ריקים. המבנה הזה מאפשר לו לעבד אודיו בקצב מהיר בהרבה מטרנסדיוסרים רגילים, בלי לאבד דיוק שמיעתי.

האימון נעשה על 64,000 שעות של דיבור באנגלית, כאשר 40,000 מתוכן מגיעות ממאגרים פרטיים והשאר ממאגרים פתוחים מוכרים. התוצאות מראות שיעור שגיאות מילים מרשים של 1.39% במבחן הנקי של Librispeech ורמות של 2.62% עד 3.56% על מערכי נתונים כמו SPGI Speech ו־TEDLIUM, שמשמעותן פענוח כמעט מושלם בהקלטות באיכות טובה.

איפה שהוא מתאמץ יותר זה בשיחות ספונטניות מרובות דוברים או פגישות עסקיות, שם שיעור השגיאות קופץ לאזור ה־14% וה־15% במבחנים כמו AMI ו־Earnings-22. הוא עדיין מתמודד עם זה בצורה סבירה, אבל אי אפשר לצפות לאותו דיוק שמקבלים בהרצאה מוקלטת מראש.

מתאים ל

  • תמלול הרצאות ופודקאסטים

    אידיאלי לעיבוד מהיר של תוכן מוקלט מראש באנגלית עם דובר יחיד או דיבור ברור.

  • בניית כתוביות אוטומטיות

    מנגנון ה־TDT מקצר את זמני הריצה ומאפשר להפיק תמלול מדויק לקובצי וידאו גדולים.

  • בסיס לאימון מותאם אישית

    ארכיטקטורה חזקה ב־NeMo שמאפשרת לבצע fine-tuning לתחומים מקצועיים כמו רפואה או משפטים.

איפה זה נופל

החיסרון המרכזי כאן הוא היעדר מוחלט של תמיכה בשפות אחרות. המודל יודע לעבוד אך ורק באנגלית, ואינו מסוגל לתמלל אות אחת בעברית. בנוסף, הפלט מוחזר באותיות קטנות בלבד ללא אותיות גדולות וללא סימני פיסוק מלאים, מה שמחייב עיבוד נוסף אם הטקסט מיועד לקריאה אנושית ישירה.

נקודה בעייתית נוספת מופיעה במבחני הוגנות, כאשר במגדרים מסוימים אחוז השגיאות זינק ל־37.57%, וגם בשיחות מרובות רעשי רקע הדיוק יורד משמעותית.

אותה משפחה

parakeet-tdt יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לתמלל עברית?

לא. המודל אומן אך ורק על דיבור באנגלית, והטוקנייזר שלו כולל תווים באנגלית בלבד. אם תזינו לו הקלטה בעברית, הוא ייכשל לחלוטין ולא יחזיר פלט הגיוני.

האם הטקסט שמתקבל כולל סימני פיסוק ואותיות גדולות?

לא, הפלט מופק כולו באותיות קטנות ללא אותיות גדולות בתחילת משפטים וללא פיסוק עשיר. אם אתם צריכים טקסט ייצוגי למשתמשי קצה, תצטרכו להעביר את התוצאה דרך מודל ייעודי להחזרת פיסוק.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית NeMo של אנבידיה יחד עם PyTorch, ולטעון את המשקלים ששוקלים כ־4.0 גיגהבייט ישירות מתוך הקוד באמצעות המחלקה הייעודית לטרנסדיוסר. המודל דורש אודיו מונו בקצב דגימה של 16,000 הרץ, כך שכל קובץ אחר יחייב המרה מוקדמת לפני ששולחים אותו לפונקציית התמלול.

מבחינת חומרה, מודל של 1.1 מיליארד פרמטרים דורש כרטיס מסך מודרני עם לפחות 8 עד 12 גיגהבייט זיכרון גרפי כדי לעבוד בנוחות ובמהירות. אם אין לכם תשתית עם GPU ייעודי של אנבידיה או שאתם צריכים תמלול מזדמן של קבצים בודדים בחודש, החזקת שרת כזה תהיה יקרה ולא משתלמת בהשוואה לשירותי ענן מוכנים.

pip install -U huggingface_hub
hf download nvidia/parakeet-tdt-1.1b

הקבצים

3 קבצים במאגר, 4.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC-BY-4.0, רישיון קוד פתוח מתירני מאוד שמאפשר להשתמש במודל, לשנות אותו, לשלב אותו במוצרים מסחריים ולהפיץ אותו בחופשיות. התנאי היחיד הוא מתן קרדיט ברור לאנבידיה ול־Suno כיוצרי המודל המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗