GPT
B

Belle-whisper-large-v3-zh

קוד פתוח

BELLE-2apache-2.02024-03-11

  • transformers
  • pytorch
  • safetensors
  • whisper
  • automatic-speech-recognition

גרסה מכווננת של Whisper שמיועדת ספציפית לתמלול בסינית. אם אתם צריכים דיוק גבוה בהקלטות מורכבות בסינית, ההתאמה הזו מציגה שיפור ניכר מול המקור של OpenAI.

  • 1.5Bפרמטרים
  • 11.5 GBמשקל הקבצים
  • 1,157הורדות בחודש
  • 128לייקים

מה זה

הצוות של BELLE לקח את whisper-large-v3 וביצע אימון מלא, ולא התאמה חלקית, על ארבעה מאגרי מידע גדולים בסינית, כולל AISHELL ו־WenetSpeech. המטרה היתה לפתור את החולשה היחסית של מודל הבסיס בשפה הזו.

התוצאות במבחני שיעור שגיאות תווים מראות שיפור יחסי שנע בין עשרים וארבעה לשישים וחמישה אחוזים לעומת המודל המקורי. השיפור מורגש בעיקר בסביבות אקוסטיות קשות, למשל מבחן הפגישות של WenetSpeech, שבו אחוז השגיאות נחתך כמעט בחצי מול גרסת הבסיס, ואף עוקף את גרסת v2 הקודמת שלהם. המשמעות היא פחות טעויות בהקלטות עם רעשי רקע או דוברים מרוחקים.

מתאים ל

  • תמלול פגישות מרובות דוברים

    המודל מציג יתרון משמעותי במבחני הקלטות פגישה בסינית, שם רעשי הרקע מכשילים מודלים כלליים.

  • עיבוד שיחות טלפון ומוקד

    אימון המודל על דאטה כמו HKUST עוזר לו להתמודד טוב יותר עם איכות שמע ירודה בסינית מדוברת.

  • תמלול וידאו ושידורי רשת

    התאמה מלאה למאגר WenetSpeech מאפשרת זיהוי טוב של תכנים מגוונים מהאינטרנט בסינית.

איפה זה נופל

המודל הזה מכוון כולו לסינית. למרות שמודל הבסיס יודע שפות רבות, אימון מלא על דאטה ייעודי עלול לפגוע ביכולות בשפות אחרות כמו אנגלית או עברית. בנוסף, קובצי המשקלים שמורים בדיוק של float32, מה שמנפח את גודל ההורדה ואת צריכת הזיכרון הראשונית אם לא ממירים אותם לפורמט קל יותר.

שאלות
נפוצות

האם המודל הזה מתאים לתמלול בעברית?

לא. המודל עבר התאמה עמוקה לסינית על גבי דאטה ייעודי. אם אתם צריכים תמלול בעברית, עדיף להשתמש במודל המקורי של OpenAI או במודל שעבר כוונון ייעודי לעברית.

מה ההבדל בינו לבין גרסת v2 של אותו צוות?

במבחנים מסוימים הציונים קרובים מאוד, אבל בגרסה הזו יש שיפור ניכר בהקלטות מורכבות ורועשות כמו פגישות, שם אחוז השגיאות ירד מ־14.5 ל־11.2.

איך מריצים

המודל שוקל 11.5 גיגה בייט ומחזיק מיליארד וחצי פרמטרים. כדי לטעון ולהריץ אותו בצורה מקומית תצטרכו כרטיס מסך עם לפחות ששה עשר גיגה זיכרון, במיוחד אם רוצים לשמור על זמני תגובה סבירים ולא להיתקע במגבלות חומרה.

ההרצה בקוד נעשית ישירות דרך transformers עם pipeline סטנדרטי לזיהוי דיבור, אבל חובה לקבע את שפת הפענוח לסינית כדי לקבל את התוצאות הרצויות. אם יש לכם הקלטה אחת בחודש או שאין לכם שרת עם GPU ייעודי, עדיף להשתמש בפתרון ענן קיים במקום לשלם על תשתית כבדה.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="BELLE-2/Belle-whisper-large-v3-zh")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗