GPT
W

whisper-medium

קוד פתוח

openaiapache-2.02022-09-26

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

מודל תמלול ותרגום אודיו רב לשוני מבית OpenAI. הוא מאזן בין דיוק גבוה לצריכת משאבים סבירה יותר מגרסאות ה־large.

  • 764Mפרמטרים
  • 11.4 GBמשקל הקבצים
  • 327,392הורדות בחודש
  • 299לייקים

מה זה

מדובר במודל מבוסס Transformer במבנה encoder-decoder, שתוכנן לקבל אודיו ולהחזיר טקסט מתומלל באותה שפה, או מתורגם ישירות לאנגלית. האימון שלו התבסס על 680,000 שעות הקלטה מהרשת בפיקוח חלש, מה שמקנה לו עמידות טובה לרעשי רקע, מבטאים שונים וז'רגון מקצועי בלי שתצטרכו לאמן אותו מחדש.

המשקל שלו עומד על 764 מיליון פרמטרים. זה ממקם אותו באמצע הסדרה, מעל small ומתחת ל־large. מתוך כלל נתוני האימון, 65 אחוזים היו באנגלית והשאר התחלקו על פני שפות שונות, כאשר המודל מציג ביצועים חזקים במיוחד בכעשר שפות מרכזיות.

מתאים ל

  • תמלול הקלטות באנגלית

    רוב נתוני האימון הם באנגלית, ולכן שם המודל מספק את רמת הדיוק והעמידות הגבוהות ביותר לרעשים.

  • תרגום שפות זרות לאנגלית

    הוא יודע להאזין לאודיו בשפה זרה ולהוציא ישירות טקסט באנגלית בלי שלב ביניים של תמלול נפרד.

  • יצירת כתוביות עם זמנים

    הספרייה מחזירה חותמות זמן לפי מקטעים, מה שמאפשר להפיק קובצי כתוביות מסונכרנים לתוכן מוקלט.

איפה זה נופל

המודל נוטה להזיות ולייצור טקסטים שלא נאמרו באודיו המקורי, תופעה שנובעת מאימון על נתונים רועשים והניסיון שלו לנחש את המילה הבאה. בנוסף, הארכיטקטורה מייצרת לעיתים חזרות אינסופיות על אותם משפטים, בעיה שחיפוש קרן לא תמיד פותר.

הביצועים שלו אינם אחידים. בשפות עם מעט נתוני אימון, או בקרב דוברים עם מבטאים ודמוגרפיות מסוימות, שיעור השגיאות קופץ משמעותית. הוא גם אינו מיועד לתמלול בזמן אמת בלי התאמות הנדסיות נוספות, ואינו כולל זיהוי דוברים מוכח.

שאלות
נפוצות

האם כדאי לבחור בגרסת medium במקום large?

זה תלוי במגבלות החומרה שלכם. גרסת medium דורשת פחות זיכרון ומאיצה את זמני הריצה בהשוואה ל־large, אך המחיר הוא ירידה מסוימת בדיוק, בעיקר בשפות שאינן אנגלית.

האם המודל יודע להבדיל בין כמה דוברים באותו קובץ?

לא באופן מובנה. הכרטיס מציין שהמודל אומן לתמלול ותרגום בלבד, ושמשימות כמו זיהוי והפרדת דוברים לא נבדקו ודורשות אימון נוסף.

איך מריצים

אתם מריצים אותו דרך ספריית transformers בפייתון באמצעות ה־pipeline הייעודי לזיהוי דיבור. הקבצים שוקלים 11.4 גיגה־בייט בפורמט float32 המקורי, כך שכדי לטעון ולהריץ אותו בנוחות תצטרכו כרטיס מסך עם זיכרון ייעודי של 12 עד 16 גיגה־בייט לפחות, או לעבור לעיבוד על מעבד מרכזי בקצב אטי בהרבה.

המבנה הפנימי שלו מעבד קטעים של עד 30 שניות בלבד. לתמלול קבצים ארוכים יותר משתמשים בחלוקה למקטעים דרך הפרמטר chunk_length_s. אם אתם מתכננים נפחי עבודה נמוכים ולא רוצים להחזיק GPU ייעודי דלוק בענן, קריאה לשירות מנוהל חיצוני תהיה זולה ופשוטה יותר.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="openai/whisper-medium")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 פתוח ומאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗