GPT
W

wav2vec2-lv-60-espeak-cv-ft

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • wav2vec2
  • automatic-speech-recognition
  • speech

המודל הזה ממיר דיבור לפונמות בכמה שפות ולא למילים רגילות. הוא מתאים למי שבונה זיהוי דיבור לשפות בלי הרבה מידע מתויג או לחוקרי בלשנות.

  • 1.2 GBמשקל הקבצים
  • 210,524הורדות בחודש
  • 70לייקים
  • 24שכבות

מה זה

מדובר במודל שמבוסס על ארכיטקטורת Wav2Vec2ForCTC עם עשרים וארבע שכבות, אשר עבר אימון על נתוני Common Voice כדי לזהות תוויות פונטיות במקום טקסט רגיל. פייסבוק בנו אותו כדי לבדוק זיהוי פונטי חוצה שפות, כולל שפות שלא נראו באימון, דרך מיפוי של תכונות הגייה.

בניגוד למודלי זיהוי דיבור סטנדרטיים שמחזירים משפטים כתובים, כאן הפלט הוא רצף של פונמות מבוססות espeak. אם המטרה שלכם היא לקבל תמלול של שיחה למילים קריאות, תצטרכו להצמיד לו מילון שממפה את הפונמות חזרה למילים, אחרת תקבלו רק ייצוג צלילי של מה שנאמר.

מתאים ל

  • זיהוי דיבור לשפות נדירות

    הוא מאפשר לבנות תמלול לשפות עם מעט נתונים בעזרת זיהוי פונמות כללי ומיפוי שלהן.

  • מחקר בלשני וניתוח הגייה

    הפלט הפונטי מאפשר לבדוק צלילים מדויקים שנאמרו במקום לנחש מילים שלמות.

  • בניית מודל תמלול ייעודי

    הוא מספק שכבה אקוסטית מוכנה שפולטת פונמות ישירות אל מפענח מבוסס מילון.

איפה זה נופל

החיסרון המרכזי הוא שהמודל לא פולט מילים. הוא מחזיר רצף פונטי בלבד, מה שאומר שחייבים לבנות שכבת עיבוד נוספת ומילון כדי לקבל טקסט קריא. בנוסף, חובה להמיר מראש כל קובץ שמע לדיגום של 16kHz, ואין כאן מנגנון תיקון שגיאות מובנה שמנחש מילים מתוך הקשר של משפט שלם.

שאלות
נפוצות

האם המודל מוציא טקסט בעברית ישירות מהקלט?

לא. הוא מוציא מחרוזת של תוויות פונטיות בינלאומיות ולא אותיות או מילים רגילות. כדי לקבל עברית כתובה תצטרכו לחבר לו מילון חיצוני שממיר את הפונמות למילים בעברית.

איזה כרטיס מסך צריך בשביל להריץ אותו?

המשקל של הקבצים הוא 1.2 גיגהבייט בלבד, כך שכל כרטיס מסך מודרני פשוט עם כמה גיגהבייט של זיכרון יספיק. הוא יכול לרוץ בקלות גם על מעבד מחשב סטנדרטי בלי חומרה מיוחדת.

איך מריצים

המודל שוקל 1.2 גיגהבייט ורץ דרך ספריית transformers בפורמט float32. זה גודל קומפקטי שאפשר להריץ בלי בעיה על מעבד רגיל או על כרטיס מסך בסיסי עם מעט זיכרון.

נקודה שחובה להקפיד עליה היא שהאודיו חייב להיכנס בקצב דגימה של 16kHz בדיוק, אחרת המודל מוציא זבל. אם אתם צריכים זיהוי דיבור פשוט בענן למילים מוכרות, עדיף לפנות לממשק API מוכן של תמלול, כי להריץ את זה דורש מכם לתחזק בעצמכם את שלב המרת הפונמות לטקסט.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="facebook/wav2vec2-lv-60-espeak-cv-ft")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. מותר להשתמש בהם בפרויקטים מסחריים, לשנות אותם ולהפיץ אותם בתוך מוצר, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗