GPT
B

Breeze-ASR-25

קוד פתוח

MediaTek-Researchapache-2.02025-06-06

  • safetensors
  • whisper
  • automatic-speech-recognition
  • zh
  • en

התאמה של וויספר לזיהוי דיבור במנדרינית טייוואנית ובשילוב שוטף עם אנגלית. הוא פותר את הנטייה המוכרת של מודלים קיימים לתרגם מילים באנגלית למנדרינית במקום לתמלל אותן כפי שנאמרו.

  • 1.5Bפרמטרים
  • 14.9 GBמשקל הקבצים
  • 28,646הורדות בחודש
  • 143לייקים

מה זה

מדובר בכיוונון של Whisper-large-v2 שביצעה מדיה-טק, עם דגש על שילוב שפות בתוך אותו משפט, תופעה נפוצה בשיחות יומיומיות ועסקיות שבהן דוברים עוברים הלוך ושוב בין מנדרינית לאנגלית. האימון כלל עשרת אלפים שעות של שמע מסונתז במנדרינית, לצד כאלף ושבע מאות שעות אמיתיות באנגלית ומערך קטן של שילוב שפות. בנוסף, בוצעו שיפורים בהצמדת חותמות זמן לצורך יצירת כתוביות.

ההבדל מורגש בעיקר במבחני שילוב שפות. במבחן CSZS-zh-en שיעור שגיאות המילים ירד ל־13.01 בהשוואה ל־29.49 בוויספר המקורי ול־26.43 בגרסה שלוש. מודלים כלליים נוטים להמיר מונחים טכניים באנגלית למילים סיניות שנשמעות דומה, בעוד שהגרסה הזו שומרת על המילים באנגלית כפי שנאמרו.

מתאים ל

  • תמלול פגישות בהייטק

    מתאים לשיחות עבודה בטייוואן שבהן מונחים טכניים באנגלית נשזרים בדיבור במנדרינית.

  • יצירת כתוביות לסרטונים

    כולל שיפור מובנה בהצמדת חותמות זמן, מה שמצמצם את הצורך בתיקון ידני של סנכרון.

  • ניתוח הרצאות ושיעורים

    מזהה שמות מושגים באנגלית בתוך הרצאות טכנולוגיות ואקדמיות בשפה הסינית.

איפה זה נופל

הוא מיועד לשתי שפות בלבד, מנדרינית ואנגלית. אם תזינו לו הקלטות בעברית או בכל שפה אחרת, תקבלו הזיות או תמלול חסר משמעות. חיסרון נוסף נובע מכך שכל נתוני האימון בסינית היו סינתטיים ונוצרו על ידי מנוע דיבור, מה שעלול לפגוע בדיוק כשיש רעשי רקע כבדים, עיוותי מיקרופון או מבטאים אזוריים שונים ממנדרינית טייוואנית. כמו כן, בבדיקות של הרצאות אקדמיות ארוכות במנדרינית נקייה הוא לא הציג יתרון מובהק לעומת הדגם המקורי, ובחלקן אף קיבל תוצאה מעט נמוכה יותר.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לתמלול עברית?

לא. המודל אומן ונבדק אך ורק על מנדרינית ואנגלית. ניסיון לתמלל איתו עברית יניב טעויות ורצפי מילים חסרי פשר.

במה הוא עדיף על הגרסאות הרשמיות של וויספר?

הוא מתמקד בבעיה המרכזית של הגרסאות הרשמיות, שהיא תרגום כפוי של מילים לסינית במקום השארתן באנגלית. אם השיחה משלבת בין השתיים, שיעור השגיאות שלו נמוך משמעותית.

האם קל להחליף מודל וויספר קיים בגרסה הזו?

כן, הקוד זהה לחלוטין. מכיוון שמדובר באותה ארכיטקטורה בדיוק, כל מה שנדרש הוא לשנות את מזהה הדגם בתוך ספריית transformers בלי לגעת בצנרת התוכנה הקיימת.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־14.9 גיגה-בייט, ומאחר שמדובר בארכיטקטורת וויספר רגילה של מיליארד וחצי פרמטרים, הרצה מקומית דורשת כרטיס מסך עם לפחות שמונה עד עשרה גיגה-בייט של זיכרון לצורך הסקת מסקנות שוטפת. המודל נתמך ישירות בספריית transformers דרך מודול הצינור הרגיל של פייתון, כך שאין צורך בקוד מיוחד.

אם אתם צריכים תמלול שוטף בסביבת ענן שאינה מחזיקה שרתי עיבוד ייעודיים, עלויות החומרה להרצה עצמית של מודל בגודל כזה יהיו גבוהות בהרבה משימוש בשירות חיצוני. הרצה עצמית שווה את המאמץ רק כשעובדים בסביבה מקומית סגורה או בהיקפי תמלול עצומים שמצדיקים שרת ייעודי.

pip install -U huggingface_hub
hf download MediaTek-Research/Breeze-ASR-25

הרישיון

הפצה תחת רישיון apache-2.0 מאפשרת שימוש מסחרי מלא, שינוי של הקוד והמשקלים והטמעה במוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון השינויים שנעשו, בלי תמלוגים או דרישה לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗