GPT
B

Breeze-ASR-26

קוד פתוח

MediaTek-Researchapache-2.02025-11-28

  • transformers
  • safetensors
  • whisper
  • automatic-speech-recognition
  • taiwanese-hokkien

המודל הזה ממיר דיבור בניב הטאיוואני טאי-גי ישירות לטקסט בסימניות מנדרינית. הוא מיועד למי שצריך תמלול מדויק לניב מקומי שלא נתמך היטב במודלי שפה רגילים.

  • 1.5Bפרמטרים
  • 5.8 GBמשקל הקבצים
  • 16,169הורדות בחודש
  • 79לייקים

מה זה

בבסיס שלו נמצא Whisper שעבר אימון נוסף על כעשרת אלפים שעות של דיבור סינתטי בטאי-גי. המבנה מבוסס על 1.5 מיליארד פרמטרים ומשתמש בטוקנייזר הרב לשוני הרגיל, אך המטרה כאן מאוד ממוקדת: להקשיב לאודיו בטאי-גי ולכתוב את התוצאה בסימניות סיניות תקניות, תוך התחשבות במעברים חופשיים בין טאי-גי למנדרינית.

במבחני ביצועים שנערכו על שלושים הקלטות שירות ציבורי מטאיוואן, הוא השיג שיעור שגיאות תווים ממוצע של 30.13%. לשם השוואה, מודל Whisper רגיל שמכוון למנדרינית הגיע באותו מבחן לשגיאה של 49.99%, מה שמראה שאימון ייעודי לניב הזה הוא קריטי. מצד שני, ממוצע של שלושים אחוז שגיאה אומר שכל תו שלישי עדיין דורש בדיקה.

מתאים ל

  • תמלול שיחות בטאי-גי

    ממיר דיבור בניב טאי-גי לסימניות מנדרינית ישירות, במקום להשתמש במודל כללי שנכשל על הניב הזה.

  • מדידת מודלי דיבור מקומיים

    משמש כמודל ייחוס למדידת איכות של מערכות שמייצרות קול בטאי-גי על בסיס שיעור שגיאות תווים.

  • הנגשת תכנים בטאיוואן

    מסייע לחילוץ כתוביות במנדרינית מתוך שידורי רדיו, הודעות לציבור ופודקאסטים שמוקלטים בניב המקומי.

איפה זה נופל

הנתון הכי בעייתי הוא הפער הגדול בין הדגימות. שיעור השגיאות נע בין 14.49% בהקלטות נקיות ועד 52.78% בקטעים מאתגרים, כך שחצי מהטקסט עלול לצאת משובש לחלוטין. בנוסף, כל המידע שעליו אומן המודל הוא שמע סינתטי, ולא הקלטות אנושיות ספונטניות מהחיים עצמם, מה שעלול לייצר כשלים מול מבטאים כבדים וסלנג. החיסרון המשמעותי ביותר הוא שהפלט מתקבל בסימניות מנדרינית ולא בכתב טאי-גי מקורי.

שאלות
נפוצות

האם המודל תומך בעברית או באנגלית?

טכנית הבסיס הוא Whisper שמכיר שפות נוספות, אבל הגרסה הזו עברה כוונון ממוקד מאוד עבור טאי-גי ומנדרינית. היא לא נבדקה ולא מיועדת לעיבוד שמע בשפות אחרות, ולכן לא תקבלו תוצאות שמישות בעברית.

למה הטקסט שמתקבל הוא במנדרינית ולא בכתב טאי-גי?

החוקרים בחרו להוציא סימניות מנדריניות בגלל החפיפה באוצר המילים והקלות בהערכת הדיוק. מערכות שמוציאות כתב טאי-גי אותנטי דורשות עיבוד שונה, וכאן המטרה הייתה תרגום טבעי לכתב הנפוץ בטאיוואן.

איך מריצים

המשקל הכולל של הקבצים מגיע לכמעט 5.8 גיגה בייט והוא נטען באמצעות transformers ישירות בתבנית המוכרת של Whisper. כדי להריץ מודל עם מיליארד וחצי פרמטרים בפורמט float32 המקורי תצטרכו כרטיס מסך עם לפחות שמונה עד עשרה גיגה זיכרון גרפי פנוי, או להמיר אותו לחצי דיוק כדי לחסוך מקום.

אין כאן גרסאות מוקטנות או סריאליזציות שונות בחבילה, וההפצה מכילה רק את משקלי המודל הגולמיים. אם אתם בונים שירות סביב אודיו בטאיוואנית ואין לכם שרת עם מאיץ ייעודי, עדיף להריץ שירות מנוהל חיצוני או לעבוד עם מודלים רב שימושיים דרך API, במיוחד אם נפח השמע שלכם קטן.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="MediaTek-Research/Breeze-ASR-26")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. מותר לקחת אותו, להטמיע בתוך מוצר מסחרי, לשנות את הקוד ולהריץ בענן או במחשב מקומי בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗