GPT
W

whisper-large

קוד פתוח

openaiapache-2.02022-09-26

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

מודל תמלול ותרגום קולי חזק במיוחד, שאומן על מאות אלפי שעות ומספק דיוק גבוה גם ברעש וללא כוונון. בוחרים בו כשצריכים איכות מקסימלית בשפות מרכזיות ומוכנים לשלם על זה במשאבים.

  • 1.5Bפרמטרים
  • 23.0 GBמשקל הקבצים
  • 40,448הורדות בחודש
  • 554לייקים

מה זה

מדובר במודל זיהוי דיבור ותרגום מבוסס ארכיטקטורת רצף לרצף, עם כמיליארד וחצי פרמטרים. המאמנים שלו השתמשו ב־680,000 שעות של שמע מתויג מהאינטרנט, מתוכן 65% באנגלית והשאר ב־98 שפות אחרות, בשיטת פיקוח חלש שמקנה לו עמידות טבעית לרעשי רקע, שפה טכנית ומבטאים בלי שצריך לאמן אותו מחדש לכל משימה.

הוא מסוגל לתמלל שמע לשפת המקור, או לתרגם שפות שונות ישירות לטקסט באנגלית. ההבדל בינו לבין הגרסאות הקטנות יותר במשפחה הוא היכולת להתמודד עם שפות מרובות ולא רק אנגלית, לצד רמת דיוק גבוהה בהרבה שמתקרבת לרף המוביל בתחום, אם כי יוצריו מדגישים שביצועים חזקים באמת נרשמו בכעשר שפות עיקריות.

מתאים ל

  • תמלול הקלטות באנגלית

    אידיאלי לשיחות עמוסות רעשי רקע ומינוח מקצועי, תחום שבו הוא נשען על 438,000 שעות אימון.

  • תרגום שמע ישירות לאנגלית

    מבצע מעבר ישיר משמע בשפות נתמכות כמו צרפתית, ספרדית או גרמנית לקובץ טקסט באנגלית.

  • הפקת כתוביות עם חותמות זמן

    הארכיטקטורה יודעת לחלץ זמנים ברמת הרצף, מה שמאפשר לייצר קובצי כתוביות מדויקים להקלטות.

איפה זה נופל

המודל נוטה להזיות, כלומר להמציא משפטים שלא נאמרו כלל בהקלטה, בגלל שילוב של אימון על נתונים רועשים מהרשת והנטייה המובנית שלו לנחש את המילה הבאה. בנוסף, הוא סובל מחזרתיות מציקה על אותם קטעי טקסט, תופעה שניתן לרסן רק חלקית בעזרת כוונון פרמטרי הדגימה.

יש לו גם מגבלה טכנית מובנית של קטעי שמע עד 30 שניות, כך שתמלול קבצים ארוכים מחייב שימוש באלגוריתם חלוקה למקטעים. הביצועים שלו אינם אחידים ויורדים משמעותית בשפות מעוטות משאבים, ואין להסתמך עליו מחוץ לקופסה לצורך זיהוי דוברים או תמלול בזמן אמת.

אותה משפחה

whisper-large יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לתמלול בזמן אמת?

לא מחוץ לקופסה. בגלל הגודל שלו, כמיליארד וחצי פרמטרים, ודרישות המשאבים הכבדות, הוא מתוכנן לתמלול קבצים ולא לזיהוי דיבור ישיר ומיידי.

האם זה המודל הכי עדכני בסדרה?

לא, המפתחים הוציאו עדכון שנקרא large-v2 שאומן על יותר איטרציות ומציג תוצאות טובות יותר באותו גודל ארכיטקטורה. הם עצמם ממליצים להעדיף את גרסת v2 על פני המודל המקורי הזה.

איך מתמללים הקלטה שנמשכת שעה שלמה?

המודל מעבד חלונות של עד 30 שניות בלבד. כדי לתמלל שמע ארוך מפעילים את מנגנון הצינור בספריית transformers עם חלוקה למקטעים של 30 שניות.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־23 גיגה בייט בדיוק float32, כך שחייבים מאיץ גרפי חזק עם זיכרון משמעותי כדי לטעון ולהריץ אותו, במיוחד אם רוצים לעבוד עם עיבוד באצוות. הטעינה נעשית ישירות דרך ספריית transformers, תוך שימוש במעבד קלט שממיר את השמע לספקטרוגרמות.

אם נפח התמלול שלכם נמוך או שאין לכם גישה לשרת עם GPU ייעודי מתאים, שירות מנוהל חיצוני יהיה משתלם יותר מאשר להחזיק תשתית כבדה כזו באוויר. מי שמחזיק שרתים מתאימים יכול להריץ אותו מקומית ולקבל שליטה מלאה על התהליך ללא עלויות תמלול שוטפות.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="openai/whisper-large")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה חופשית בתוך מוצרים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובה לחשוף את הקוד של המוצר שבו שילבתם את המודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗