GPT
R

reazonspeech-nemo-v2

קוד פתוח

reazon-researchapache-2.02024-01-30

  • nemo
  • automatic-speech-recognition
  • NeMo
  • ja

מודל תמלול ייעודי ליפנית שמסוגל להתמודד עם קבצי אודיו של שעות ברצף. הוא מבוסס על NeMo של אנבידיה ופותר בעיית זיכרון מוכרת בהקלטות ארוכות.

  • 2.3 GBמשקל הקבצים
  • 1,310הורדות בחודש
  • 39לייקים

מה זה

מדובר במודל זיהוי דיבור בגודל של 619 מיליון פרמטרים שאומן על מאגר הנתונים ReazonSpeech v2.0. הבסיס שלו הוא ארכיטקטורת Fast Conformer בתצורת RNN-T, אבל עם שינוי מהותי במנגנון הקשב של הקידוד. במקום קשב מלא שתופס המון זיכרון ככל שההקלטה מתארכת, שילבו כאן מנגנון Longformer עם חלון מקומי של 256 טוקנים וטוקן גלובלי יחיד.

המשמעות של המבנה הזה היא היכולת לעבד הקלטות יפנית של שעות בלי לחתוך אותן למקטעים קטנים קודם לכן. המפענח מסתמך על אוצר מילים קומפקטי יחסית של 3000 מונחים מבוססי SentencePiece, והאימון עצמו רץ לאורך מיליון צעדים באופטימייזר AdamW.

מתאים ל

  • תמלול הרצאות ופודקאסטים

    הוא מעבד אודיו של שעות ברצף ביפנית בלי צורך לחתוך קבצים לחלקים קטנים.

  • עיבוד שיחות וידאו ארוכות

    מנגנון הקשב של Longformer מאפשר ריצה יעילה של הקלטות פגישות ממושכות ביפנית.

  • שירות תמלול פנימי בארגון

    רישיון פתוח שמאפשר להריץ עיבוד מקומי למידע רגיש בלי לשלוח שום קובץ החוצה.

איפה זה נופל

הבעיה המרכזית עבור מפתחים ישראלים היא השפה. המודל תומך ביפנית בלבד, כך שהוא חסר תועלת לחלוטין עבור עברית או אנגלית, ואם יש בהקלטה שילוב של מילים בשפות זרות הוא צפוי להיכשל בהן. בנוסף, הכרטיס לא מציג מדדי דיוק מספריים מול סטים סטנדרטיים, כך שחובה לבדוק אותו על דגימות קול אמיתיות עם רעשי רקע לפני שמשלבים אותו במוצר.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לתמלל שיחות בעברית?

לא. המודל אומן על נתונים ביפנית בלבד ויודע לפלוט טקסט ביפנית. הוא לא מזהה עברית או שפות אחרות.

למה דווקא המודל הזה ולא מודל ASR כללי?

בגלל השילוב של Fast Conformer עם Longformer שמותאם להקלטות ארוכות. הוא לא נחנק על קבצים של שעות, בתנאי שהתוכן הוא ביפנית.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.3 גיגה בייט, כך שכל כרטיס מסך מודרני עם שמונה עד שנים עשר גיגה בייט זיכרון יריץ אותו בקלות. ההרצה דורשת התקנה של ספריית NeMo והחבילה הייעודית של reazonspeech בפייתון, כשטעינת המודל והתמלול נעשים בכמה שורות קוד פשוטות.

אם אתם צריכים לתמלל הקלטות ארוכות ביפנית בתוך תשתית מקומית או פרטית, יש היגיון מלא בלהרים אותו בעצמכם. לעומת זאת, אם נפח העבודה שלכם נמוך מאוד או שאתם לא רוצים להחזיק שרת פועל עם GPU, שירותי ענן מסחריים יחסכו לכם את התחזוקה.

pip install -U huggingface_hub
hf download reazon-research/reazonspeech-nemo-v2

הקבצים

3 קבצים במאגר, 2.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי חופשי לחלוטין. אתם יכולים לקחת את המשקלים, לשנות את הקוד ולשלב אותם במוצר סגור או פתוח, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗