GPT
W

whisper-base.en

קוד פתוח

openaiapache-2.02022-09-26

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

תמלול אנגלית יעיל ומקומי שלא דורש שרת מפלצתי. משקל של גיגה אחד הופך אותו לפתרון מהיר למחשב אישי או שרת קטן.

  • 73Mפרמטרים
  • 1.1 GBמשקל הקבצים
  • 258,707הורדות בחודש
  • 45לייקים

מה זה

מדובר בגרסת בסיס לתמלול אנגלית בלבד ממשפחת וויספר של OpenAI, עם שישה שכבות וקצת מעל שבעים ושניים מיליון פרמטרים. האימון המקורי נעשה על שש מאות ושמונים אלף שעות של הקלטות מהרשת תחת פיקוח חלש, מה שמקנה לו עמידות טובה יחסית לרעשי רקע ומבטאים בלי כיול מחדש.

ההבדל העיקרי מול הגרסה הרב־לשונית המקבילה הוא המיקוד. המודל הזה לא יודע לתרגם ולא מכיר שום שפה חוץ מאנגלית, אבל כל המשקל והקיבולת שלו מוקדשים לשפה אחת, מה שנותן יציבות גבוהה יותר בגודל הקטן הזה.

מתאים ל

  • תמלול שיחות פנימיות באנגלית

    רץ מקומית על שרת קיים בלי לשלוח מידע רגיש לשירותי ענן חיצוניים.

  • הפקת כתוביות לסרטונים

    מייצר חותמות זמן מדויקות לכל מקטע אודיו באמצעות הגדרת return_timestamps.

  • פיתוח אפליקציות במכשיר קצה

    גודל קובץ של 1.1 גיגה מאפשר להריץ אותו ישירות על לפטופים ומחשבי משרד.

איפה זה נופל

המגבלה המרכזית היא הזיות. בגלל ארכיטקטורת sequence to sequence והאימון על נתונים רועשים מהרשת, המודל מנסה לנחש את המילה הבאה ולפעמים פשוט ממציא טקסט שלא נאמר בהקלטה, או נתקע בלולאות של משפטים שחוזרים על עצמם.

הכרטיס מדגיש במפורש שיש הבדלי דיוק בין מבטאים ודמוגרפיות שונות. בנוסף, הוא לא מיועד לתמלול בזמן אמת ישר מהקופסה, ולא נבדק למשימות כמו זיהוי דוברים או חלוקה לפי דובר בלי אימון נוסף.

שאלות
נפוצות

האם המודל הזה מבין עברית?

לא. זו גרסה ייעודית לאנגלית בלבד (en). אם תזינו לו עברית תקבלו ג'יבריש או ניסיון שגוי לתמלל באנגלית, ועבור שפות אחרות צריך לבחור בגרסה הרב־לשונית.

איך מתמודדים עם תופעת ההזיות והטקסט שחוזר על עצמו?

OpenAI מציינים בתיעוד ששימוש בחיפוש אלומה (beam search) וכוונון פרמטר הטמפרטורה בריצה מפחיתים את הבעיה, אך הם לא פותרים אותה לחלוטין בהקלטות עם שקט ממושך או רעש חזק.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם WhisperProcessor או בתוך pipeline סטנדרטי. המודל מעבד קטעים של עד שלושים שניות בכל פעם, וכדי לעבוד עם קבצים ארוכים מגדירים חלוקה למקטעים דרך chunk_length_s.

במשקל קבצים של 1.1 גיגה, כל מעבד מודרני מריץ אותו בקלות בלי כרטיס מסך ייעודי, אם כי הרצה על GPU תספק מהירות גבוהה בהרבה. אין שום סיבה לשלם על API חיצוני אם יש לכם שרת פשוט ואתם צריכים לתמלל כמויות קטנות עד בינוניות של אנגלית.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="openai/whisper-base.en")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗