GPT
W

whisper-large-v3-turbo

קוד פתוח

openaimit2024-10-01

  • transformers
  • safetensors
  • whisper
  • automatic-speech-recognition
  • audio

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

גרסה מכווצת ומהירה יותר לתמלול דיבור של OpenAI, שחותכת את זמני הריצה כמעט בחצי בלי לאבד יותר מדי דיוק ביחס לגרסה הגדולה המקורית.

  • 809Mפרמטרים
  • 1.5 GBמשקל הקבצים
  • 6,902,995הורדות בחודש
  • 3,309לייקים

מה זה

מדובר בגרסה מנוונת ומכווננת של Whisper large-v3 המקורי. המבנה נשאר כמעט זהה, חוץ משינוי אחד מרכזי: כמות שכבות הפענוח קוצצה מ־32 ל־4 בלבד. הצעד הזה הוריד את מספר הפרמטרים מ־1,550 מיליון ל־809 מיליון, מה שהופך אותו למהיר משמעותית בהסקה, תוך ירידה קלה בלבד באיכות התמלול.

הוא מתמלל אודיו בשפות המקור שלו ומתרגם דיבור ישירות לאנגלית, כשהוא מגיע מאומן מראש לתרחישי zero-shot. הוא יודע להוציא חותמות זמן ברמת המשפט או המילה הבודדת, ומתמודד עם רעשי רקע ומבטאים טוב יותר ממערכות תמלול ותיקות בזכות אימון על מעל חמישה מיליון שעות שמע מגוונות.

מתאים ל

  • תמלול פודקאסטים והרצאות

    הוא רץ מהר בהרבה מהדגם המלא, מוציא חותמות זמן מדויקות למילים, ומתמודד מצוין עם קבצים ארוכים.

  • תרגום שיחות לאנגלית

    יכולת תרגום מובנית ישירות מדיבור בשפות זרות לטקסט אנגלי, בלי צורך לחבר מודל תרגום נפרד.

  • יצירת כתוביות לסרטונים

    חלוקת המילים המובנית שלו מאפשרת לסנכרן כתוביות וידאו בצורה אוטומטית כמעט בלי עריכה ידנית.

איפה זה נופל

האימון התבסס על נתונים רועשים ברשת, ולכן המודל נוטה להזיות ולייצור טקסטים שלא נאמרו באודיו כלל. הארכיטקטורה שלו נתקעת לפעמים בלופים של חזרתיות על אותן מילים, בעיקר בהקלטות עם שקט ממושך או רעש לא ברור.

הביצועים שלו לא אחידים בין שפות שונות, ורמת הדיוק צונחת בשפות עם מעט נתוני אימון או במבטאים חריגים. בנוסף, הוא לא מיועד לתמלול בזמן אמת מחוץ לקופסה, ולא מזהה בעצמו מי הדובר או מתי יש פעילות קולית בלי כוונון נוסף.

שאלות
נפוצות

כמה איכות מאבדים לעומת הגרסה הגדולה הרגילה?

הירידה באיכות קטנה מאוד ברוב המקרים, כי שלב הקידוד נשאר מלא ורק המפענח כווץ ל־4 שכבות. באנגלית ובשפות פופולריות בקושי תרגישו בהבדל בשיחות יומיומיות, אבל בשפות חלשות או בהקלטות באיכות נמוכה הוא יטה ליותר שגיאות והזיות.

אפשר להריץ אותו בזמן אמת על שידור חי?

לא ישר מהקופסה. המודל בנוי לקלוט קטעי אודיו של עד 30 שניות ומחזיר טקסט בסיום הניתוח. כדי להגיע לזמן אמת תצטרכו לבנות סביבו מנגנון שגוזר את האודיו למקטעים קצרים ומזרים אותם ברצף.

האם הוא מזהה שפה בעצמו?

כן, הוא מזהה את שפת הדיבור באופן אוטומטי. יחד עם זאת, אם אתם יודעים מראש באיזו שפה מדובר, עדיף לקבע את הפרמטר כדי לחסוך זמן חישוב ולמנוע זיהוי שגוי בקטעים קצרים.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers ב־Python, כשהמשקל הכולל של הקבצים עומד על 1.5 גיגה-בייט בלבד בפורמט float16. אפשר להריץ אותו בקלות על כרטיס מסך בודד עם 6 עד 8 גיגה זיכרון VRAM, ואפשר להאיץ אותו פי 4.5 עם torch.compile, או לחבר לו Flash Attention 2 ו־SDPA אם החומרה שלכם תומכת בכך.

בשביל קבצים ארוכים מחצי דקה תצטרכו להגדיר חלוקה למקטעים של 30 שניות או ריצה עוקבת עם חלון נע. אם יש לכם נפח קבוע של תמלולים, שרת ייעודי זול עם כרטיס מסך פשוט יספיק פה לגמרי, אבל אם יש לכם פיקים לא צפויים, החזקת תשתית כזו באוויר תעלה יותר מסתם שליחת קבצים ל־API חיצוני.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="openai/whisper-large-v3-turbo")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים מופצים תחת רישיון MIT, שזה הרישיון הכי פתוח ונוח שיש. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לסגור את הקוד ולשלב אותו בכל מוצר בלי לשלם תמלוגים, כשהדרישה היחידה היא לשמור על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗