GPT
W

whisper-large-v3

קוד פתוח

openaiapache-2.02023-11-07

  • transformers
  • pytorch
  • jax
  • safetensors
  • whisper

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

תמלול אודיו ותרגום לאנגלית עם חוסן גבוה לרעשים ומבטאים. הגרסה הזו מורידה בין 10% ל־20% מכמות השגיאות של הדור הקודם בזכות אימון על 5 מיליון שעות שמע.

  • 1.5Bפרמטרים
  • 23.0 GBמשקל הקבצים
  • 5,106,140הורדות בחודש
  • 6,257לייקים

מה זה

מדובר בארכיטקטורת sequence-to-sequence מבוססת Transformer עם 1.5 מיליארד פרמטרים ו־32 שכבות, שתוכננה לתמלל שמע בשפת המקור או לתרגם אותו ישירות לאנגלית. השינויים הטכניים לעומת הגרסאות הקודמות של המודל הגדול כוללים מעבר לספקטרוגרם של 128 ערוצי Mel במקום 80, והוספת טוקן ייעודי לקנטונזית. בסיס האימון הורכב ממיליון שעות עם תיוג חלש ועוד ארבעה מיליון שעות שמע עם פסאודו־תיוג שנוצר בעזרת גרסה קודמת.

המשמעות המעשית של הפחתת השגיאות בשיעור של 10% עד 20% היא דיוק יציב יותר כשמתמודדים עם הקלטות בעייתיות. המודל מתמודד בצורה טובה יותר עם דיבור טכני, מוזיקת רקע או מבטאים זרים, ועושה את זה בלי צורך בהתאמה מיוחדת מראש. לצד התמלול, הוא מסוגל לחלץ חותמות זמן ברמת המשפט או ברמת המילה הבודדת.

מתאים ל

  • חילוץ כתוביות לסרטונים

    יכולת החזרת חותמות זמן ברמת המילה והמשפט מאפשרת לייצר קובצי תזמון מדויקים להרצאות ולתכני וידאו.

  • תמלול הקלטות שטח רועשות

    האימון על מיליוני שעות שמע מייצר עמידות גבוהה להפרעות רקע, בלי צורך בסינון רעשים מקדים.

  • תרגום שיחות לאנגלית

    תרגום ישיר משפות מקור שונות לטקסט אנגלי בפעימה אחת, בלי לעבור קודם דרך תמלול שפת המקור.

איפה זה נופל

האימון על נתונים רועשים גורם למודל להמציא מילים ומשפטים שלא נאמרו מעולם בהקלטה, תופעה שמחמירה ככל שהשפה מדוברת פחות או שיש בה פחות מידע באימון. בנוסף, המבנה שלו נוטה להיתקע בלולאות של חזרתיות על אותו משפט, וחיפוש בקרניים לא פותר את זה תמיד. היוצרים מודים שהביצועים אינם אחידים בין שפות שונות, ושיש הבדלי דיוק ממשיים בין מבטאים ודמוגרפיות שונות. המודל לא תוכנן לזיהוי דוברים, ולא מתאים לעבודה בזמן אמת ללא פיתוח שכבות התאמה מסביבו.

אותה משפחה

whisper-large יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מסוגל לתמלל שידור חי ללא השהיה?

הכרטיס מציין שהמודל אינו בנוי לעבודה בזמן אמת מהקופסה בגלל גודלו וחלון הניתוח של 30 שניות. כדי להגיע לביצועים קרובים לזמן אמת נדרש פיתוח תשתיתי נוסף של חלוקה למקטעים והזרמת נתונים.

האם אפשר להשתמש במודל כדי לזהות מי הדובר בהקלטה?

לא, המודל אומן לתמלל ולתרגם דיבור בלבד. מפתחי המודל מבהירים שהוא לא נבדק למשימות של זיהוי דוברים או סיווג אישי, וממליצים לא להשתמש בו למטרות אלה ללא אימון ייעודי נוסף.

איך מריצים

טעינה של 1.5 מיליארד פרמטרים ב־float16 דורשת כרטיס מסך עם לפחות 8 עד 10 גיגה־בייט זיכרון גרפי פנוי, עוד לפני שמחשבים את זיכרון העבודה עבור הקלטות ארוכות ועיבוד במקבצים. הספריה transformers מאפשרת להריץ אותו דרך פונקציית pipeline ייעודית לתמלול, שתומכת בהאצה באמצעות Flash Attention 2 או SDPA המובנה ב־PyTorch. אם בוחרים להאיץ עם torch.compile, מהירות העיבוד עולה פי 4.5, אבל החיבור הזה שובר כרגע את אלגוריתם הפירוק למקטעים של קבצים ארוכים.

המודל מנתח חלונות קבועים של 30 שניות, כך ששמע ארוך מחייב פיצול למקטעים או חלון נע. אם יש לכם קבצים בודדים שמגיעים מדי פעם, החזקה של כרטיס מסך פעיל בענן עולה יותר מתשלום מבוסס שימוש לפי דקת שמע בספקי צד שלישי. שרת עצמאי הופך למשתלם רק כשיש תעבורה רציפה של שעות שמע ביום, או כשיש חובה מוחלטת לשמור את הקבצים מקומית.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="openai/whisper-large-v3")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי מלא, שינוי של קוד המקור והפצה שלו בתוך מוצרים סגורים או פתוחים ללא תשלום תמלוגים. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗