GPT
W

whisper-small

קוד פתוח

openaiapache-2.02022-09-26

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

תמלול אודיו ותרגום לשפות שונות במשקל נוח שמתאים לחומרה צנועה. הוא נותן נקודת איזון סבירה בין משאבים לדיוק, במיוחד אם רוב החומר שלכם באנגלית.

  • 242Mפרמטרים
  • 3.6 GBמשקל הקבצים
  • 3,035,223הורדות בחודש
  • 598לייקים

מה זה

מדובר במודל זיהוי דיבור ותרגום מקבילי ממשפחת Whisper, עם כמעט 242 מיליון פרמטרים וארכיטקטורת רצף לרצף. הוא הגיע אחרי אימון על 680 אלף שעות של הקלטות עם פיקוח חלש מהרשת, כשיותר משישים וחמישה אחוזים מהן באנגלית והשאר מתחלקות על כמעט מאה שפות שונות. המבנה הזה נותן לו להתמודד טוב יחסית עם רעשי רקע, מבטאים ומונחים טכניים בלי שתצטרכו לאמן אותו מחדש על כל דומיין.

הוא יושב בדיוק באמצע הסדרה, מעל גרסאות tiny ו־base הקטנות יותר ומתחת ל־medium ו־large. בניגוד לגרסה המקבילה שמיועדת לאנגלית בלבד, המודל הזה מתמלל ישירות בשפת המקור או מתרגם את האודיו לאנגלית, אבל הדיוק שלו בשפות שאינן בין עשר המובילות צונח בהתאם למיעוט הנתונים שהיו עליהן באימון.

מתאים ל

  • תמלול פודקאסטים באנגלית

    הוא מזהה מונחים ומבטאים היטב ולא דורש כרטיס מסך יקר בשביל להפיק טקסט מדויק מקבצים ארוכים.

  • תרגום הקלטות לאנגלית

    הוא מבצע המרה ותרגום ישיר משפות נתמכות לאנגלית בצעד אחד בלי שרשור של שני מודלים נפרדים.

  • יצירת כתוביות עם חותמות זמן

    הוא מחזיר מקטעי תמלול מתוזמנים לפי שניות, מה שמתאים להרכבת קובצי כתוביות לסרטונים.

איפה זה נופל

האימון על נתונים רועשים גורם לו לפעמים להמציא משפטים שלא נאמרו בהקלטה, בעיקר כשהוא מנסה לנחש את המילה הבאה על בסיס שפה במקום להקשיב לצליל. בנוסף, המבנה שלו נוטה לחזור על אותם רצפי מילים בלולאה. הכרטיס מבהיר שהוא לא מתאים לזיהוי דוברים, לא עובד בזמן אמת בלי התאמות, ולא מיועד למערכות קבלת החלטות שבהן שגיאות תמלול פוגעות בבני אדם.

שאלות
נפוצות

האם המודל תומך בעברית ברמה טובה?

עברית אינה מופיעה ברשימת השפות המרכזיות שנבדקו בכרטיס המודל. רוב האימון נעשה על אנגלית ושפות בולטות אחרות, והביצועים יורדים ככל שיש פחות מידע על השפה. כדאי לבדוק אותו על מדגם הקלטות לפני שבונים עליו למוצר בעברית.

האם הוא מסוגל לתמלל קבצי אודיו של שעה ברצף?

הארכיטקטורה מטפלת במקטעים של עד שלושים שניות בכל פעם. כדי לתמלל קבצים ארוכים מפעילים מנגנון חלוקה שמחלק את האודיו לחלקים ומאחד את התוצאות, והוא מובנה בצינור העבודה של הספרייה.

איך מריצים

מריצים אותו ישירות דרך ספריית transformers בפייתון באמצעות הצינור של automatic-speech-recognition, עם אודיו במקטעים של עד שלושים שניות או באלגוריתם חלוקה שמטפל בקבצים ארוכים. המודל שוקל 3.6 גיגה בייט בדיוק מלא, כך שכרטיס מסך בסיסי עם ארבעה עד שמונה גיגה זיכרון יספיק כדי להריץ תהליכים מהירים בלי להיחנק, ואפשר להריץ אותו גם על מעבד רגיל אם הזמן לא לוחץ.

אם אתם צריכים תמלול שוטף לנפחים גדולים מאוד בלי לתחזק שרתים וזיכרון, קריאה לשירות ענן מנוהל תחסוך כאבי ראש. להרצה מקומית יש היגיון כשרוצים לשמור על פרטיות ההקלטות או כשכבר יש חומרה זמינה.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="openai/whisper-small")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לגמרי, כולל שימוש מסחרי מלא, הפצה, שינוי הקוד ושילוב שלו במוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗