GPT
P

parakeet-tdt_ctc-0.6b-ja

קוד פתוח

nvidiacc-by-4.02024-05-13

  • nemo
  • automatic-speech-recognition
  • speech
  • audio
  • Transducer

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

תמלול יפנית כולל פיסוק שמכוון למהירות גבוהה במיוחד. שילוב בין FastConformer לחיזוי משכי זמן חוסך חישובי סרק על מקטעים ריקים בזמן הריצה.

  • 2.3 GBמשקל הקבצים
  • 5,308הורדות בחודש
  • 60לייקים

מה זה

מדובר במודל זיהוי דיבור בגודל 0.6 מיליארד פרמטרים שמתמקד ביפנית בלבד ומוציא טקסט ישירות עם סימני פיסוק. הוא נשען על ארכיטקטורה היברידית שמשלבת מפענח CTC עם TDT, מנגנון שחוזה יחד גם את הטוקן וגם את משך הזמן שלו ומדלג על עד ארבעה פריימים ריקים בכל צעד. הגישה הזו נותנת לו יתרון ביצועים ברור בריצה ביחס למפענחי Transducer רגילים, בלי לאבד דיוק בדרך.

הוא אומן על קורפוס ReazonSpeech v2.0 שכולל מעל 35 אלף שעות של דיבור יפני טבעי, עם טוקנייזר SentencePiece של 3,072 יחידות. במבחני שיעור שגיאות תווים ללא מודל שפה חיצוני, מפענח ה־TDT שלו הגיע ל־6.4 אחוז שגיאה על JSUT basic5000, ול־13.2 אחוז על MCV 16.1 test. המספרים מראים דיוק יפה בהקלטות נקיות, אבל נפילה מורגשת יותר כשמגיעים לנתוני בדיקה מגוונים ופחות מבוקרים.

מתאים ל

  • תמלול שיחות והרצאות ביפנית

    אימון על 35 אלף שעות דיבור טבעי מאפשר לו לתפוס יפנית שוטפת כולל סימני פיסוק ישירות מההקלטה.

  • עיבוד אודיו מקומי ומהיר

    מנגנון ה־TDT מדלג על פריימים ריקים וחוסך זמן עיבוד משמעותי על שרתים עצמאיים.

  • אימון המשך על נתונים פרטיים

    גודל של 0.6 מיליארד פרמטרים ומשקל קל מאפשרים כוונון עדין יציב וזול בתוך NeMo.

איפה זה נופל

הוא מוגבל אך ורק ליפנית, כך שאינו מתאים לתמלול מעורב של עברית או אנגלית. במבחן MCV 16.1 שיעור השגיאות שלו מגיע ל־13.2 אחוזים בבדיקה חמדנית, פער ניכר לעומת הנתונים על סטים פשוטים יותר. בנוסף, חובה להמיר מראש כל קובץ קול לפורמט מונו של 16 קילוהרץ לפני שליחה למודל.

שאלות
נפוצות

האם המודל מזהה עברית או אנגלית?

לא. המודל אומן אך ורק על יפנית ומכיל טוקנייזר ייעודי לשפה זו. כל קלט בשפה אחרת יפיק שגיאות או תווים לא קשורים.

מה עדיף, לפענח עם TDT או עם CTC?

ברירת המחדל היא TDT, שמספק תוצאות מעט יותר מדויקות בבדיקות ומציע מהירות עבודה גבוהה יותר בזכות דילוג על פריימים ריקים. מפענח ה־CTC זמין כחלופה באותה הרצה, אך מציג שיעור שגיאות מעט גבוה יותר.

האם אפשר להריץ אותו דרך NVIDIA Riva?

לפי כרטיס המודל, הוא עדיין לא נתמך באופן מובנה במסגרת Riva. בשלב זה ההרצה מתבצעת ישירות דרך קוד פייתון עם ספריית NeMo.

איך מריצים

בשביל להריץ אותו צריך להתקין את ספריית NeMo של אנבידיה ואת PyTorch. המשקל של הקבצים עומד על 2.3 גיגהבייט, כך שהוא יושב בנוחות על כל כרטיס מסך מודרני עם זיכרון גרפי צנוע ולא דורש שרתים מנופחים. ברירת המחדל עובדת עם TDT, אבל אפשר להעביר אותו למצב CTC ישירות בהגדרות.

קלט האודיו חייב להיות קובץ wav בערוץ בודד מונו ובקצב דגימה של 16,000 הרץ, אחרת תקבלו תוצאות עקומות או שגיאות. אם המערכת שלכם כבר מבוססת על ספריות סטנדרטיות אחרות כמו Transformers, קחו בחשבון שהחיבור כאן מחייב את התשתית של NeMo ולא נתמך עדיין בפתרונות ארוזים כמו NVIDIA Riva.

pip install -U huggingface_hub
hf download nvidia/parakeet-tdt_ctc-0.6b-ja

הקבצים

3 קבצים במאגר, 2.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC-BY-4.0. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולהפיץ אותו כחלק ממוצר, בתנאי שנותנים קרדיט מתאים ליוצרים ולא מוסיפים מגבלות משפטיות שסותרות את תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗