GPT
W

wav2vec2-large-xlsr-persian-v3

קוד פתוח

m3hrdadfiרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • wav2vec2
  • automatic-speech-recognition

התאמה ייעודית של מודל שמיעה לפרסית עם שיעור שגיאות מילים נמוך יחסית. הוא מתאים למי שצריך תמלול מדויק לקול בפרסית בלבד ללא תמיכה בשפות נוספות.

  • 2.4 GBמשקל הקבצים
  • 1,419הורדות בחודש
  • 43לייקים
  • 24שכבות

מה זה

מדובר במודל זיהוי דיבור אוטומטי מבוסס Wav2Vec2 עם 24 שכבות, שעבר כוונון ייעודי על מאגר Common Voice בפרסית. הבסיס שלו הוא מודל הדיבור הרב-לשוני של מטא, אבל כאן המשקלים ממוקדים לגמרי בשפה הפרסית בלבד.

בבדיקות שנעשו על קבוצת המבחן של המאגר הוא הגיע לתוצאת WER של 10.36 אחוזים. המשמעות בשטח היא שכאשר מקליטים באיכות טובה ובתנאים ברורים, אחת מכל עשר מילים בערך עלולה לדרוש תיקון, שזה נתון יציב לתמלול בסיסי של שפה יחידה.

משקל הקבצים עומד על 2.4 גיגה-בייט, גודל סטנדרטי לארכיטקטורה הזו. כדי לעבוד איתו צריך להשתמש בספריות עיבוד טקסט ייעודיות לפרסית כמו parsivar וסקריפטים של ניקוי שהיוצר צירף, אחרת הדיוק יורד משמעותית.

מתאים ל

  • תמלול הקלטות קוליות בפרסית

    הוא מגיע לדיוק סביר של 10.36% שגיאות מילים על שמע נקי שנדגם ב־16kHz.

  • המרת הודעות קוליות לטקסט

    מתאים לשילוב בבוטים שקולטים הודעות בפרסית ומעבירים אותן כטקסט מנורמל.

  • יצירת כתוביות לתוכן בפרסית

    עובד ישירות מול ספריות קוד פתוח מוכרות ומאפשר הפקת טקסט רציף מקבצי שמע.

איפה זה נופל

המודל אומן רק על פרסית ועל קולות מתוך Common Voice, מה שאומר שהוא עלול להתקשות עם מבטאים חריגים, רעשי רקע של שיחות טלפון או דיבור מקוטע. בנוסף, הדרישה לקדם-עיבוד דרך סקריפט ספציפי של היוצר וספריות כמו parsivar יוצרת תלות ישירה בלוגיקת ניקוי חיצונית, ובלי הדגימה המדויקת של 16kHz הוא לא יפיק תוצאות שמישות.

שאלות
נפוצות

האם אפשר לתמלל איתו עברית או אנגלית?

לא, המודל הזה כוונן ספציפית ומלאה לשפה הפרסית בלבד. הוא לא יזהה מילים בעברית או באנגלית ויחזיר שגיאות או פלט משובש לחלוטין.

מה החומרה המינימלית הנדרשת כדי להריץ אותו?

הקבצים שוקלים 2.4 גיגה-בייט, כך שמעבד גרפי מודרני עם 6 עד 8 גיגה-בייט זיכרון יספיק לעיבוד מהיר. אפשר להריץ אותו גם על מעבד רגיל, אבל התמלול יהיה איטי בהרבה ולא יתאים לזמן אמת.

מדוע חובה להשתמש בסקריפט הניקוי שמצורף למודל?

המודל אומן מול טקסט שעבר סטנדרטיזציה באמצעות הספריות parsivar ו־normalizer.py. אם תזינו או תשוו טקסט גולמי ללא הנרמול הזה, תווים פרסיים ייפלו והדיוק יצנח.

איך מריצים

כדי להריץ אותו צריך סביבת פייתון עם transformers, torchaudio וספריות לעיבוד שמע כמו librosa. חובה להמיר את כל קובצי השמע לקצב דגימה של 16kHz לפני ששולחים אותם למודל, אחרת הפלט ייפגע לחלוטין. בנוסף, חובה להוריד את קובצי הנרמול הייעודיים שהיוצר פרסם כדי לעבד את הטקסט.

עם משקל של 2.4 גיגה-בייט אפשר להריץ אותו על מעבד גרפי סטנדרטי עם לפחות 6 או 8 גיגה-בייט זיכרון בלי בעיה מיוחדת. אם אין לכם שרת ייעודי או שאתם לא רוצים לתחזק שרשרת קדם עיבוד שלמה לשמע ולטקסט בפרסית, עדיף לבדוק שירותי ענן מוכנים במקום להחזיק את התשתית הזו בעצמכם.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="m3hrdadfi/wav2vec2-large-xlsr-persian-v3")
print(pipe("שלום"))

הרישיון

היוצר לא דיווח על רישיון עבור המודל. מבחינה משפטית מדובר בשטח אפור, ואסור להניח שמותר להשתמש בו במוצר מסחרי ללא בדיקה ישירה מול המפרסם.

הרישיון המלא בעמוד המודל ↗