GPT
W

whisper-medium.en

קוד פתוח

openaiapache-2.02022-09-26

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

גרסה ייעודית לאנגלית בת כ־764 מיליון פרמטרים מסדרת וויספר. היא מיועדת למי שצריך תמלול מדויק באנגלית בלי לבזבז זיכרון על עשרות שפות אחרות.

  • 764Mפרמטרים
  • 11.4 GBמשקל הקבצים
  • 33,958הורדות בחודש
  • 60לייקים

מה זה

מדובר במודל זיהוי דיבור מסוג סקוונס־טו־סקוונס, שמבוסס על ארכיטקטורת קידוד ופענוח של טרנספורמר עם עשרים וארבע שכבות. הוא אומן על מאות אלפי שעות שמע ומלל מהרשת, תוך התמקדות בלעדית בשפה האנגלית. בניגוד לגרסאות הרב־לשוניות של המיזם, המודל הזה מתעלם לחלוטין מכל שפה שאינה אנגלית, ובזכות זה כל המשקולות שלו מוקדשות לדיוק תחבירי ופונטי באנגלית בלבד.

הוא מקבל מקטעי שמע, ממיר אותם לספקטרוגרמות באמצעות מעבד תואם, ופולט טקסט ישיר. הגודל שלו יושב באמצע הסדרה, מעל גרסאות הבסיס והגרסה הקטנה אבל מתחת לגרסת הענק, מה שנותן איזון סביר בין דיוק ביטויי ועמידות לרעשי רקע לבין דרישות חומרה.

מתאים ל

  • תמלול פודקאסטים באנגלית

    הוא מציג עמידות טובה למבטאים ולמונחים טכניים, ומייצר חותמות זמן לפסקאות שלמות.

  • המרת שיחות תמיכה למלל

    הוא מתמודד היטב עם רעשי רקע של שיחות טלפון באנגלית בלי צורך באימון מיוחד.

  • סנכרון כתוביות לסרטונים

    ממשק החלוקה למקטעים מחזיר טווח זמנים מוגדר לכל משפט, מה שמקל על יצירת קובצי כתוביות.

איפה זה נופל

המודל אומן בפיקוח חלש על מידע רועש מהאינטרנט, ולכן הוא נוטה להזיות ולייצור טקסטים שלא נאמרו כלל בהקלטה. מבנה הפענוח גורם לו לפעמים להיכנס ללולאות של חזרתיות אינסופית על אותן מילים. בנוסף, הוא מוגבל לטעינה של שלושים שניות בכל פעם ודורש אלגוריתם חיתוך חיצוני כדי לתמלל שיחות ארוכות. הוא גם מציג פערים בביצועים בין מבטאים ודמוגרפיות שונות, ולא תומך באף מילה בעברית.

שאלות
נפוצות

האם המודל יודע לתמלל או להבין עברית?

לא. מדובר בגרסת en בלבד, והיא אומנה על אנגלית בלבד. אם תזינו לה הקלטה בעברית, תקבלו ג'יבריש, הזיות או ניסיון פונטי שגוי להמיר את הצלילים למילים באנגלית.

האם אפשר לתמלל איתו הקלטות ארוכות של שעה ברצף?

הארכיטקטורה תומכת ישירות בעד שלושים שניות בלבד. כדי לתמלל שעה צריך להשתמש במנגנון חיתוך מקטעים, כמו זה שמובנה בצינור התמלול של transformers, שמחלק את השמע ומחבר את התוצאות.

איך מריצים

טעינת המודל נעשית בעזרת ספריית transformers בפייתון, דרך ממשק ייעודי או צינור עיבוד מלא שמחלק את הקבצים לחלונות של שלושים שניות. המודל שוקל 11.4 גיגה־בייט בקובצי float32, כך שחובה להחזיק כרטיס גרפי עם זיכרון וידאו מספק כדי לקבל זמני תגובה הגיוניים, או לחלופין לבצע המרה לרמות דיוק נמוכות יותר.

אם אתם מתכננים לעבד כמה שעות בודדות בחודש, הרמת שרת עם מאיץ גרפי מתאים תעלה יותר זמן וכסף מתשלום לפי דקה לספק ענן חיצוני. הרצה עצמית שווה את המאמץ רק כשיש עומס תמלול קבוע וגבוה, או כשחייבים להשאיר את המידע בתוך הרשת המקומית בגלל פרטיות.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="openai/whisper-medium.en")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗