GPT
W

whisper-large-v2

קוד פתוח

openaiapache-2.02022-12-05

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

זה מודל לתמלול ותרגום אודיו שלמד ממאות אלפי שעות דיבור. בוחרים בו כשרוצים להתמודד עם רעשי רקע, מבטאים ותרגום לאנגלית בלי לאמן מודל מאפס.

  • 1.5Bפרמטרים
  • 23.0 GBמשקל הקבצים
  • 157,423הורדות בחודש
  • 1,809לייקים

מה זה

מדובר במודל sequence-to-sequence מבוסס טרנספורמר עם 32 שכבות, שאומן על 680,000 שעות של קבצי שמע ותמלילים מהאינטרנט. מתוך הדאטה הזה, 65% היו באנגלית, 18% שמע בשפות אחרות עם תרגום לאנגלית, ועוד 17% תמלול ישיר בשפות שאינן אנגלית שמכסות 98 שפות שונות. בניגוד לגרסאות הקטנות יותר בסדרה שמגיעות גם בגרסה ייעודית לאנגלית בלבד, הגרסה הזו מגיעה ישירות בריבוי שפות.

ההבדל בין הגרסה הזו לבין ה־large המקורית הוא אימון לאורך פי 2.5 יותר אפוקים, לצד רגולריזציה נוספת כדי לשפר את הביצועים. חוץ מתמלול של השפה המדוברת עצמה, הוא מסוגל לקחת אודיו בשפה זרה ולתרגם אותו ישירות לטקסט באנגלית. הוא מציג דיוק גבוה בעשר שפות מובילות, ומתמודד טוב יחסית עם רעשי רקע, מבטאים קשים וז'רגון טכני.

מתאים ל

  • תמלול פודקאסטים והקלטות

    הוא מטפל מעולה בשמע עם רעשי רקע, ז'רגון מקצועי ומבטאים, ויודע לפצל הקלטות ארוכות למקטעים עם זמנים.

  • תרגום הרצאות לאנגלית

    הוא מתוכנן מראש לקלוט אודיו בעשרות שפות שונות ולהוציא ישירות טקסט מתורגם באנגלית בלי שלב ביניים.

  • הנגשת תכני וידאו

    המודל מחזיר חותמות זמן מדויקות לפי משפטים, מה שמאפשר לייצר קובצי כתוביות מסונכרנים ישירות מהדיבור.

איפה זה נופל

האימון נעשה על דאטה רועש עם פיקוח חלש, מה שגורם לו לפעמים להזות מילים ומשפטים שלא נאמרו מעולם בהקלטה. הארכיטקטורה שלו גם נוטה להיתקע בלולאות של טקסט שחוזר על עצמו שוב ושוב.

הביצועים שלו תלויים לחלוטין בכמות המידע שהייתה באימון. שפות עם מעט דאטה או מבטאים ספציפיים מקבלות אחוזי שגיאה גבוהים בהרבה בהשוואה לאנגלית. בנוסף, הוא לא מיועד לתמלול בזמן אמת, והוא לא יודע לזהות דוברים שונים או לסווג מאפיינים אישיים של הדובר.

אותה משפחה

whisper-large יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לזיהוי דוברים שונים בהקלטה?

לא מחוץ לקופסה. המודל מתמחה בתמלול ותרגום של המילים בלבד, והיוצרים מציינים במפורש שהוא לא הוערך למשימות של חלוקה לפי דוברים או זיהוי קולות ללא אימון נוסף.

האם הוא מתאים לעיבוד שיחות טלפון בשידור חי?

לא. המודל בנוי לקלוט קטעי אודיו ולעבד אותם, ובשל גודלו והארכיטקטורה שלו הוא לא תוכנן לתמלול בזמן אמת בלי התאמות מורכבות ותשתית ייעודית.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך רציני עם זיכרון משמעותי, כי קבצי המודל שוקלים 23 גיגה בייט בדיוק של float32. ברירת המחדל שלו מוגבלת לקטעי שמע של עד 30 שניות, כך שאם אתם עובדים עם הקלטות ארוכות יותר, חובה להשתמש במנגנון חלוקה למקטעים כמו זה שקיים ב־pipeline של ספריית transformers, שגם מאפשר לחלץ חותמות זמן לפי מקטעים.

אם יש לכם קבצים בודדים פה ושם, כנראה שאין טעם להחזיק שרת ייעודי שדולק כל הזמן ולספוג את העלויות של כרטיס מסך חזק. במצב כזה הגיוני יותר לשלוח קריאות API לשירות מנוהל. התקנה מקומית משתלמת כשמעבדים כמויות עצומות של שמע או כשיש דרישות אבטחה שלא מאפשרות להוציא את האודיו החוצה.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="openai/whisper-large-v2")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות משוחררים תחת רישיון apache-2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להריץ אותו בשרתים פרטיים ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים וכתב הוויתור על האחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗