GPT
W

wav2vec2-large-xlsr-korean

קוד פתוח

kresnikapache-2.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • wav2vec2
  • automatic-speech-recognition

התאמה קוריאנית ממוקדת על בסיס wav2vec 2.0 לתמלול דיבור ישיר לטקסט. הוא מיועד למי שצריך תמלול מדויק לקוריאנית בלבד בלי המשקל של מודלים רב לשוניים ענקיים.

  • 317Mפרמטרים
  • 4.7 GBמשקל הקבצים
  • 1,005,159הורדות בחודש
  • 56לייקים

מה זה

מדובר במודל זיהוי דיבור של כ־317 מיליון פרמטרים, שנבנה על בסיס XLSR ועבר אימון ייעודי לקוריאנית. הוא לא מודל שפה ולא מייצר טקסט חופשי, אלא מקבל אודיו ופולט אותיות בעזרת ארכיטקטורת CTC ישירה. הגודל שלו נשאר קומפקטי יחסית לתחום, ולכן קל לשלב אותו בצינור עיבוד קיים דרך ספריית transformers הרגילה.

במבחן Zeroth-Korean המודל מציג שיעור שגיאות מילים של 4.74% ושיעור שגיאות תווים של 1.78%. בקוריאנית מדד התווים קריטי בגלל מבנה ההברות, וזה מראה שהמודל מפענח נכון את רוב הפונמות הבסיסיות בהקלטות נקיות.

מתאים ל

  • תמלול שיחות בקוריאנית

    זיהוי קולי מדויק בהקלטות קוריאנית נקיות בזכות שיעור שגיאות תווים נמוך של 1.78 אחוזים.

  • הטמעה בשרתים מקומיים

    משקל של 4.7 גיגה מאפשר להריץ אותו ישירות על חומרה עצמאית בלי תלות בשירותי ענן יקרים.

  • חילוץ פקודות קוליות

    ארכיטקטורת CTC מייצרת תגובה מהירה שמתאימה לקליטת פקודות בדיבור בלי השהיות כבדות.

איפה זה נופל

המודל יודע רק קוריאנית. אין לו שום תמיכה בעברית או באנגלית מעורבבת, כך שכל מונח טכני בלועזי עלול להתחרבש לגמרי. בנוסף, מדדי הדיוק המרשימים נבדקו על קורפוס ספציפי ונקי, והכרטיס לא מפרט איך הוא מתמודד עם רעשי רקע, מבטאים שונים או דיבור יומיומי קטוע. אסור להכניס אותו ישירות למוצר בלי לבדוק קודם איך הוא מגיב להקלטות אמיתיות מהשטח.

שאלות
נפוצות

האם המודל מזהה מילים בעברית או באנגלית?

לא. המודל אומן והותאם לשפה הקוריאנית בלבד. אם תזינו לו אודיו באנגלית או בעברית, הוא ינסה להמיר את הצלילים להברות קוריאניות וייצר פלט חסר משמעות.

האם אפשר להריץ אותו ישירות על המעבד בלי כרטיס מסך?

אפשר, אבל זה יהיה אטי. עם 317 מיליון פרמטרים תמלול של קבצים ארוכים על מעבד ייקח זמן רב, ולכן לעבודה רציפה מומלץ להשתמש במאיץ גרפי בסיסי.

איך מריצים

כדי להריץ אותו צריך בסך הכול מעבד גרפי צנוע. קובצי המודל שוקלים 4.7 גיגה בייט בדיוק של float32, כך שכרטיס מסך פשוט עם 6 עד 8 גיגה זיכרון יספיק לתמלול שוטף, ואפשר גם להמיר אותו לחצי דיוק כדי לחסוך מקום.

ההרצה נעשית ישירות דרך פייתון, ואין כאן גרסאות שונות לבחור ביניהן. אם אתם צריכים לתמלל כמויות קטנות מדי פעם, עדיף להשתמש ב־API מוכן ולא לתחזק שרת, אבל למערכת מקומית או לעיבוד שדורש פרטיות, הריצה העצמית פשוטה מאוד.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="kresnik/wav2vec2-large-xlsr-korean")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה חופשית בתוך המוצר שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות משפטית מצד היוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗