GPT
W

wav2vec2-base-vietnamese-250h

קוד פתוח

nguyenvulebinhcc-by-nc-4.02022-03-02

  • transformers
  • pytorch
  • wav2vec2
  • automatic-speech-recognition
  • audio

זהו מודל קל לתמלול וייטנאמית שמבוסס על Wav2Vec2 עם 95 מיליון פרמטרים. הוא מתאים למי שצריך זיהוי דיבור מקומי ומהיר בוייטנאמית בלי להרים מפלצות חישוב.

  • 1.2 GBמשקל הקבצים
  • 19,480הורדות בחודש
  • 46לייקים
  • 12שכבות

מה זה

מדובר במודל זיהוי דיבור אקוסטי מבוסס CTC שאומן מראש על 13,000 שעות אודיו מוייטנאמית מיוטיוב, ועבר כוונון עדין על 250 שעות מתויגות ממאגר VLSP. ארכיטקטורת הבסיס כוללת 12 שכבות ומשקל קבצים צנוע של 1.2 גיגה בייט, כך שהוא נכנס בקלות לזיכרון של כרטיסי מסך בסיסיים.

המפתח מספק לצד המודל גם מודל שפה של 4-grams שאומן על 2 גיגה בייט של טקסט מדובר, והשילוב הזה משנה את התמונה לחלוטין. במבחני הדיוק, שיעור השגיאות יורד מ־10.77 ל־6.15 במבחן VIVOS, ומ־18.34 ל־11.52 במאגר Common Voice כשמצרפים את מודל השפה. בלי מודל השפה, התמלול הגולמי פשוט עושה הרבה יותר טעויות איות והקשר.

מתאים ל

  • מחקר וניסויי תמלול

    מתאים לבדיקת מודלים ומחקר אקדמי בוייטנאמית בזכות ביצועים מוכחים על מאגר VIVOS.

  • פקודות קוליות קצרות

    המודל פועל מעולה על מקטעים קצרים מעשר שניות ומאפשר זיהוי קולי מקומי ומהיר.

  • תמלול ארכיוני פנימי

    פתרון חסכוני לפרויקטים ללא כוונת רווח שצריכים להמיר שמע לטקסט בלי לשלם על API חיצוני.

איפה זה נופל

הכרטיס מדגיש מגבלה קריטית: המודל מיועד לקטעי אודיו קצרים מעשר שניות בלבד, כך שלא תזרקו עליו הקלטות ארוכות בלי לחתוך אותן קודם. בנוסף, הוא דורש קצב דגימה ספציפי של 16kHz.

במבחן VLSP-T2 שיעור השגיאות מזנק ל־40.81 גם עם מודל השפה, ובלי מודל השפה הוא עומד על 51.45 שזה תמלול שגוי של מילה מכל שתיים. זה אומר שבתנאי שמע קשים או בסביבה רועשת המודל הזה מתקשה מאוד.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה למוצר מסחרי?

לא, הרישיון הוא CC BY-NC 4.0 שאוסר שימוש מסחרי מכל סוג. תצטרכו לפנות ישירות למפתח אם תרצו היתר מיוחד.

האם המודל יתמלל קובץ הקלטה של חצי שעה?

לא בצורה ישירה. המפתח מגדיר במפורש שהאודיו חייב להיות קצר מעשר שניות, כך שתצטרכו לפצל את הקובץ לחלקים קטנים לפני ההזנה.

האם חייבים להשתמש בקובץ ה־4-grams המצורף?

טכנית המודל עובד בלעדיו, אבל שיעור השגיאות עולה משמעותית. שימוש במודל השפה מוריד את השגיאות כמעט בחצי ברוב המבחנים.

איך מריצים

אתם מריצים אותו דרך ספריית transformers ב־Python, כשהאודיו חייב להיות בקצב דגימה של 16kHz ובמקטעים קצרים מעשר שניות. בגודל של 95 מיליון פרמטרים ודיוק float32, אין צורך בשרתים מורכבים, הוא ירוץ חלק על GPU ביתי פשוט ואפילו על מעבד סביר אם לא מעמיסים עליו תעבורה כבדה בזמן אמת.

אם אתם צריכים תמלול מזדמן של שפות מרובות, עדיף להשתמש ב־API מוכן של שירות ענן. המודל הזה משתלם כשאתם בונים שירות ייעודי לוייטנאמית, חייבים ריצה מקומית בלי תלות ברשת, ומוכנים לנהל את שילוב מודל ה־4-grams בקוד בעצמכם.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="nguyenvulebinh/wav2vec2-base-vietnamese-250h")
print(pipe("שלום"))

הרישיון

הרישיון הוא CC BY-NC 4.0, כלומר שימוש לא מסחרי בלבד ומחייב מתן קרדיט למפתח. אם אתם מתכננים לשלב אותו באפליקציה בתשלום, במוצר מסחרי ללקוחות או בתוך מערכת ארגונית מניבה, אתם מפרים את הרישיון. הוא מיועד למחקר, פרויקטים פנימיים או ניסויים אישיים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗