GPT
W

whisper-small.en

קוד פתוח

openaiapache-2.02022-09-26

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

גרסה קלה של מודל התמלול הפופולרי, ממוקדת באנגלית בלבד. היא מציעה דיוק מוצלח על שמע באנגלית בלי להעמיס משאבי חומרה כבדים.

  • 242Mפרמטרים
  • 3.6 GBמשקל הקבצים
  • 82,783הורדות בחודש
  • 62לייקים

מה זה

מדובר במודל מבוסס ארכיטקטורת אנסמבל של מקודד ומפענח מסוג טרנספורמר, שמכיל 242 מיליון פרמטרים. המטרה שלו ממוקדת לחלוטין: תמלול שמע באנגלית לטקסט. המודל אומן על חלק מתוך מאגר של 680 אלף שעות שמע עם תיוג חלש שנאספו מהרשת, כאשר 438 אלף שעות מתוכן היו באנגלית בלבד. בניגוד לגרסה המקבילה הרב לשונית, המודל הזה לא יודע לתרגם שפות אחרות ולא מזהה שום שפה חוץ מאנגלית.

ההתמקדות באנגלית מאפשרת לו לשמור על רמת דיוק גבוהה יחסית לנפח שלו, בלי לבזבז זיכרון על אוצר מילים ומאפיינים פונטיים של עשרות שפות אחרות. הוא יודע להתמודד עם רעשי רקע, מבטאים שונים ומונחים טכניים טוב יותר ממערכות זיהוי דיבור ישנות, ואינו דורש אימון נוסף כדי להגיע לרמה שמישה ברוב תחומי התוכן הכלליים.

מתאים ל

  • תמלול פודקאסטים באנגלית

    מאפשר הפקת תמלילים וחותמות זמן מקטעי שמע ארוכים במהירות ובעלות חישוב נמוכה.

  • מערכות שליטה קולית מקומיות

    רץ ביעילות על חומרה צנועה כדי לזהות פקודות דיבור באנגלית בלי לשלוח נתונים לענן.

  • חילוץ ציטוטים מווידאו

    טוב למיצוי מהיר של תוכן מתוך הקלטות כנסים וראיונות ללא צורך במודל כבד.

איפה זה נופל

הבעיה הבולטת ביותר במודל היא הזיות. בגלל שהאימון בוצע על נתונים גולמיים מהאינטרנט ומשלב חיזוי מילים הבאות, המודל נוטה לפעמים לייצר טקסט שלא נאמר מעולם בהקלטה, במיוחד כשיש שקט, מלמולים או רעש חריג. בנוסף, הארכיטקטורה שלו סובלת לעיתים מתקיעה בלולאות של טקסט חוזר על עצמו. המודל גם מציג פערים באיכות הזיהוי בין מבטאים, גילאים ומגדרים שונים, והוא לא מתאים כלל לשום שפה חוץ מאנגלית.

שאלות
נפוצות

האם המודל יודע לתמלל עברית?

לא. מדובר בגרסה ייעודית לאנגלית בלבד, ואוצר המילים שלה לא כולל עברית. אם אתם צריכים תמלול לעברית, יש להשתמש בגרסאות הרב לשוניות של המערכת.

איך מתמודדים עם קבצי שמע שנמשכים יותר מחצי דקה?

המודל מתוכנן טכנית לחלונות של שלושים שניות. כדי לתמלל שמע ארוך יותר, מפעילים אלגוריתם חיתוך שמחלק את הקובץ לחלקים קטנים ומאחד את התוצאות.

איך מריצים

המודל שוקל 3.6 גיגה בייט בפורמט הרשמי שלו ורץ ישירות דרך ספריית הטרנספורמרס של פייתון, באמצעות מעבד שמע מתאים וצינור עבודה סטנדרטי. הודות לגודל של 242 מיליון פרמטרים, אפשר להריץ אותו בלי בעיה על מעבד רגיל, אם כי כרטיס גרפי בסיסי עם מעט גיגה בייט של זיכרון יאיץ את קצב העבודה משמעותית. המודל בנוי מטבעו לעבד מקטעי שמע של עד שלושים שניות בכל פעם, ולכן תמלול של קבצים ארוכים מחייב שימוש במנגנון חיתוך למקטעים.

אם יש לכם עומסי תמלול כבדים של אלפי שעות בחודש, הרצה עצמית על חומרה מקומית או בענן פרטי תהיה זולה משמעותית מקריאות חוזרות לשרתים חיצוניים. לעומת זאת, אם השימוש שלכם הוא נקודתי או שאתם צריכים לפרוס פתרון מהיר בלי לנהל תלויות של פייתון וחבילות עיבוד אותות, עדיף להשתמש בשרת מנוהל.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="openai/whisper-small.en")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗