GPT
W

whisper-small-cantonese

קוד פתוח

alvanliiapache-2.02022-12-08

  • transformers
  • pytorch
  • safetensors
  • whisper
  • automatic-speech-recognition

גרסה מכווננת של וויספר לתמלול קנטונזית, ששוקלת 242 מיליון פרמטרים. היא מיועדת למי שצריך תמלול מדויק ומהיר של הניב הזה על חומרה צנועה, בלי להרים מודל ענק.

  • 242Mפרמטרים
  • 5.0 GBמשקל הקבצים
  • 1,188הורדות בחודש
  • 119לייקים

מה זה

הבסיס כאן הוא וויספר סמול של אופנאיי שעבר אימון ייעודי על מאות שעות שמע בקנטונזית, כולל נתונים מפרויקטים כמו קומון וויס וסרטוני יוטיוב. בניגוד למודל המקורי הכללי שמגמגם בניבים אזוריים של סינית, הדגם הזה מתמקד נטו בקנטונזית ומגיע לשיעור שגיאות תווים של 7.93 אחוז ללא סימני פיסוק, או 9.72 אחוז כשכוללים פיסוק, על סט הבדיקה של קומון וויס.

מבחינת ביצועים, המודל הזה מציג שיפור עקבי לעומת גרסאות קודמות שלו שהגיעו ליותר מ־15 אחוזי שגיאה. ההבדל המשמעותי בגודל הזה הוא היכולת שלו לעבוד כעוזר פענוח עבור מודל לארג'. בשילוב כזה הוא מאפשר להריץ מודל גדול בהרבה במהירות של 0.137 שניות לדגימה במקום 0.714 שניות, כמעט בלי לאבד מדיוק התוצאה.

מתאים ל

  • תמלול שיחות בקנטונזית

    הוא מגיע לדיוק סביר מאוד בהקלטות קול, תוך צריכת זיכרון מינימלית של 1.5 גיגה בכרטיס.

  • האצת מודל גדול בפענוח

    הוא משמש כמודל עזר למודל לארג' כדי לחתוך את זמני הריצה ביותר מפי חמישה.

  • הרצה מקומית על מעבדים

    הקובץ המותאם ל־whisper.cpp מאפשר לשלב תמלול קנטונזית ישירות באפליקציות קצה.

איפה זה נופל

האימון כלל 438 שעות של נתונים מיוטיוב שנוצרו על ידי תיוג ממוחשב ולא ידני, לצד מאות שעות מקומון וויס. מידע כזה עלול להחדיר שגיאות חוזרות או להטות את התמלול בהקלטות שונות מאוד ממה שהיה ביוטיוב. בנוסף, שיעור השגיאות עולה כמעט בשני אחוזים ברגע שמבקשים ממנו לשים סימני פיסוק. אם אתם צריכים תמלול רשמי עם תחביר מדויק, תצטרכו להעביר את הטקסט עריכה נוספת.

שאלות
נפוצות

האם הוא יודע לתמלל מנדרינית?

האימון והכוונון שלו ממוקדים בקנטונזית ובנתוני הונג קונג. אף על פי שבסיס המודל תומך בשפות נוספות, השימוש בו מיועד לקנטונזית, ולא כדאי להסתמך עליו עבור דיאלקטים אחרים.

איך מגיעים למהירות הריצה הכי גבוהה איתו?

מומלץ לטעון אותו עם יישום פלאש אטנשן דרך SDPA בספריית טרנספורמרס. ההבדל בזמני הריצה בכרטיס המסך הוא ירידה מ־0.308 שניות ל־0.055 שניות לדגימה.

כמה קשה להטמיע אותו בתוך FasterWhisper?

המודל כבר כולל קבצים שהומרו במיוחד ל־CT2. אפשר להוריד אותם ישירות מתיקיית הפרויקט ולהשתמש בהם בספרייה בלי לבצע המרות ידניות.

איך מריצים

כדי להריץ אותו צריך בסך הכול כ־1.5 גיגה זיכרון בכרטיס המסך. על גבי כרטיס מדגם ארטיאקס 3090 ושימוש ב־SDPA, הוא מעבד דגימה תוך 0.055 שניות בלבד. על המעבד בלבד ללא האצת חומרה, הזמן קופץ ל־2.57 שניות לדגימה, ולכן הרצה כזו לא מומלצת לעיבוד בזמן אמת.

היוצר העלה גם קובץ מומר לפורמט GGML שמתאים ל־whisper.cpp, וקבצי CT2 שמתאימים לשימוש עם FasterWhisper. אם יש לכם שרת מקומי עם מאיץ גרפי בסיסי, אין שום סיבה לשלם על API חיצוני, בעיקר בזכות דרישות הזיכרון הנמוכות שמאפשרות להרים אותו בקלות.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="alvanlii/whisper-small-cantonese")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה של המודל בתוך המוצר שלכם. הדרישה העיקרית היא לשמור על הודעת זכויות היוצרים ועותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗