GPT
S

stt_ar_fastconformer_hybrid_large_pcd_v1.0

קוד פתוח

nvidiacc-by-4.02024-12-25

  • nemo
  • speech-recognition
  • ASR
  • Arabic
  • Conformer

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

תמלול ערבית שכולל סימני ניקוד ופיסוק מלאים, בלי צורך בעבודה ידנית נוספת. הוא תופס פחות מחצי גיגה ורץ מהר מאוד על חומרה מקומית.

  • 438 MBמשקל הקבצים
  • 2,066הורדות בחודש
  • 42לייקים

מה זה

מדובר במודל זיהוי דיבור בערבית שמבוסס על ארכיטקטורת FastConformer וכולל 115 מיליון פרמטרים. הוא מפיק טקסט עם סימני ניקוד, נקודות, פסיקים וסימני שאלה בערבית. האימון שלו משלב שני מנגנוני פענוח, Transducer כברירת מחדל ו־CTC, כך שאפשר לבחור בין דיוק מעט עדיף לבין מהירות ריצה גבוהה יותר על אותו משקל בדיוק.

האימון נעשה על כ־1,100 שעות הקלטה ממספר מקורות ציבוריים. במבחני הדיוק עם מפענח Transducer הוא מגיע ל־6.55 אחוזי שגיאת מילים על מאגר EveryAyah ו־12.94 אחוזים על FLEURS, אבל נופל ל־25.6 אחוזים במאגר של Common Voice. המספרים האלה מראים בבירור שהוא מצטיין בערבית ספרותית וטקסטים מוקראים ברורים, אך מתקשה מול דיבור חופשי ופחות רשמי.

מתאים ל

  • תמלול הרצאות בערבית ספרותית

    אימון נרחב על מקורות רשמיים נותן דיוק גבוה בטקסטים פורמליים שדורשים ניקוד מדויק.

  • הפקת כתוביות לסרטוני הדרכה

    פלט שכולל פסיקים, נקודות וסימני שאלה בערבית חוסך שלבי פיסוק ידניים.

  • עיבוד אודיו על חומרת קצה

    גודל קובץ קטן של 438 מגה מאפשר הרצה מהירה מקומית גם על כרטיסי Jetson.

איפה זה נופל

הבעיה העיקרית היא ערבית מדוברת. המודל רגיש לרעשי רקע, מתקשה מאוד עם להגים מקומיים ולא מתמודד טוב עם מונחים טכניים או סלנג שלא נכללו בערכות האימון. בנוסף, הוא אינו תומך בהזרמה בזמן אמת, אינו מטפל בתווים מיוחדים, והפלט שלו עשוי לדרוש שלב נוסף של נרמול טקסט הפוך לפני שאפשר להציג אותו למשתמשי קצה.

שאלות
נפוצות

האם המודל יזהה שיחות טלפון או דיאלקטים מקומיים?

לא ברמה מספקת למוצר. התיעוד מזהיר מביצועים ירודים בלהגים ערביים ורגישות גבוהה לרעשים. הוא מיועד בעיקר לערבית סטנדרטית מודרנית וטקסטים רשמיים.

איך מחליטים בין Transducer ל־CTC בהרצה?

מפענח Transducer הוא ברירת המחדל ונותן תוצאות מדויקות יותר באחוז עד שניים במבחני שגיאות המילים. מצב CTC עדיף רק אם אתם צריכים תפוקת עיבוד מהירה עוד יותר על אותה חומרה בדיוק.

איך מריצים

ההרצה דורשת סביבת לינוקס ואת ספריית NeMo 2.0.0 של אנבידיה. הקלט חייב להיות קובץ WAV מונו בקצב דגימה של 16000 הרץ, בלי צורך בעיבוד מקדים של האודיו. מבחינת חומרה הוא קל מאוד וירוץ בלי בעיה גם על כרטיסי מסך צנועים מסדרות ישנות יותר כמו טיורינג, וולטה או אפילו Jetson, לצד תמיכה מלאה בכרטיסים מודרניים. בכרטיס A5000 נמדדו קצבי פענוח מהירים במיוחד שעוברים פי אלף מזמן אמת.

למי שבונה שירות עם נפח תנועה גדול ומעבד קבצים במרוכז, הרצה עצמית כאן חוסכת עלויות ענן משמעותיות. מצד שני, אם אתם צריכים תמלול תוך כדי דיבור בזמן אמת, המודל הזה לא מתאים כי הוא תומך אך ורק בעיבוד של קבצים שלמים.

pip install -U huggingface_hub
hf download nvidia/stt_ar_fastconformer_hybrid_large_pcd_v1.0

הקבצים

3 קבצים במאגר, 438 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC-BY-4.0, שמתיר שימוש מסחרי ולא מסחרי, שינויים והפצה. התנאי היחיד הוא מתן קרדיט נאות למפרסמים המקוריים וציון של שינויים אם נעשו כאלה. אפשר להטמיע אותו במוצר חופשי כל עוד שומרים על תנאי הייחוס.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗