GPT
W

whisper-large-v3-russian

קוד פתוח

antony66רישיון לא דווח2024-05-17

  • transformers
  • safetensors
  • whisper
  • automatic-speech-recognition
  • asr

גרסה מכווננת של וויספר לרוסית שמורידה את שיעור שגיאות המילים לרוסית נקייה. היא מתאימה למי שצריך תמלול מדויק של קבצי שמע ברוסית ומחפש שיפור על פני מודל הבסיס.

  • 1.5Bפרמטרים
  • 2.9 GBמשקל הקבצים
  • 7,651הורדות בחודש
  • 104לייקים

מה זה

מדובר בכוונון עדין של המודל הגדול של וויספר מבית אופנאיי, שהתמקד כולו בשפה הרוסית על בסיס נתוני קומון וויס 17. היוצר לקח מעל 200 אלף שורות קול, חילק אותן מחדש לאימון ובדיקה ביחס של 95 מול 5, והריץ אימון שנמשך מעל 60 שעות על שני כרטיסי טסלה של 80 גיגה.

התוצאה במספרים היא ירידה של מדד שגיאות המילים מ־9.84 במודל המקורי ל־6.39 כאן, על סט המבחן הספציפי שכלל 11,883 רשומות. בפועל זה אומר פחות פספוסים ותמלול מדויק יותר של מילים ברוסית, במיוחד בהקלטות קול ברורות שמזכירות את נתוני המקור.

מתאים ל

  • תמלול הקלטות קוליות ברוסית

    הורדת שיעור השגיאות ל־6.39 נותנת דיוק עדיף על פני מודל הבסיס ברוסית.

  • עיבוד שיחות אחרי נירמול

    המודל מכוון לשיחות, בתנאי שמריצים עיבוד מקדים עם סוקס לפי ההנחיות.

  • בדיקת איכות על נתוני דיבור

    טוב להשוואת ביצועים מול המודל המקורי על קובצי קומון וויס.

איפה זה נופל

היוצר מציין בעצמו שהמודל עדיין בעבודה ומטרת היעד שלו, תמלול איכותי של שיחות טלפון, טרם הושלמה במלואה. האימון התבסס על קריאת משפטים בקומון וויס, ולכן על הקלטות רקע רועשות או דיבור ספונטני ומקוטע התוצאות יהיו פחות טובות בלי עיבוד מקדים מדויק של הסאונד.

שאלות
נפוצות

האם כדאי להשתמש בו לשיחות טלפון אמיתיות של מוקד שירות?

אפשר לנסות, אבל היוצר מגדיר אותו כעבודה בתהליך ומחפש עוד דאטה בתחום. תצטרכו להריץ נירמול ווליום קפדני לפי ההוראות שלו, וגם אז התוצאות עלולות לדרוש בדיקה ידנית.

האם המודל תומך בשפות נוספות חוץ מרוסית?

הכוונון נעשה ספציפית על דאטה רוסי, והשפה היחידה שמדווחת היא רוסית. אם אתם צריכים עברית או אנגלית באותו קובץ, עדיף להישאר עם מודל הבסיס הרב־לשוני.

איך מריצים

כדי להריץ אותו צריך ספריית טרנספורמרס וכרטיס מסך עם מספיק זיכרון להחזיק מודל של מיליארד וחצי פרמטרים. הקבצים שוקלים קרוב לשלושה גיגה בפורמט ביפלוט16, כך שתצטרכו כרטיס מודרני כדי לקבל זמני תגובה טובים.

אם אתם מתמללים שיחות טלפון, היוצר מנחה לעשות עיבוד מקדים לקובץ בעזרת תוכנת סוקס, לנרמל את הווליום ולהמיר ל־16 קילוהרץ לפני ששולחים למודל. מי שלא מחזיק שרת ייעודי או צריך לעבד שעות ספורות בלבד בחודש, יעדיף לרוב לפנות לפתרונות ענן במקום לתחזק חומרה מתאימה בבית.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="antony66/whisper-large-v3-russian")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא דווח רישיון כלל. המשמעות עבורכם היא שאין היתר שימוש ברור, במיוחד לא למוצרים מסחריים, ואי אפשר להסתמך עליו בסביבה עסקית בלי לברר קודם את תנאי ההפצה ישירות מול היוצר.

הרישיון המלא בעמוד המודל ↗