GPT
W

whisper-base

קוד פתוח

openaiapache-2.02022-09-26

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

תמלול ותרגום קולי רב לשוני בחבילה של 73 מיליון פרמטרים. פתרון מהיר שרץ כמעט על כל מעבד מקומי בלי לדרוש שרתי ענק.

  • 73Mפרמטרים
  • 1.1 GBמשקל הקבצים
  • 1,712,755הורדות בחודש
  • 288לייקים

מה זה

מדובר בגרסת הבסיס הרב לשונית של Whisper, ארכיטקטורת sequence-to-sequence מבוססת שנאים עם 6 שכבות בלבד. המודל אומן על 680,000 שעות של שמע מתויג מהרשת באמצעות פיקוח חלש. מתוכן 65% היו באנגלית, 18% שמע בשפות אחרות עם תרגום לאנגלית, ורק 17% תמלול שפת מקור בלבד על פני 98 שפות.

הוא מתמלל שמע בשפת המקור ומתרגם משפות שונות ישירות לאנגלית ללא שלב ביניים של טקסט. היתרון הגדול בגודל הזה הוא היכולת לזהות דיבור באופן סביר מול רעשי רקע ומבטאים, בלי צורך באימון מקדים על הנתונים שלכם.

מתאים ל

  • תמלול פקודות קצרות

    קליטת קטעי שמע של שניות בודדות באנגלית או שפות נפוצות ישירות על המכשיר.

  • תרגום שמע לאנגלית

    המרת קבצי קול משפות זרות לטקסט אנגלי בעלות חישובית נמוכה.

  • תיוג ראשוני למאגרי שמע

    חילוץ טקסט גולמי מתוך כמויות גדולות של הקלטות ללא עלויות תשתית כבדות.

איפה זה נופל

בגלל אופן האימון והגודל המצומצם, המודל נוטה להזיות ולחזרות אינסופיות על אותן מילים, במיוחד ברקע שקט או רעש לא ברור. הביצועים שלו תלויים לחלוטין בכמות השעות שבהן אומנה כל שפה, ובשפות עם מעט נתונים אחוזי השגיאה קופצים משמעותית. הוא גם אינו בנוי לזיהוי דוברים או להחלטות קריטיות שבהן כל מילה קובעת.

שאלות
נפוצות

האם המודל מתאים לתמלול בזמן אמת?

לא מחוץ לקופסה. הארכיטקטורה מעבדת בלוקים של 30 שניות, כך שנדרשת עבודת פיתוח נוספת על חלוקת השמע כדי להתקרב לזמן אמת.

מה עושים אם יש הקלטות של שעות?

משתמשים ביכולת ה־chunking המובנית בספרייה, שמחלקת את הקובץ לחלונות של 30 שניות ומחברת את הטקסט בחזרה כולל חותמות זמן.

כמה שפות המודל מבין באופן שמיש?

הוא אומן על 98 שפות שונות, אך התיעוד מדגיש שתוצאות טובות באמת מתקבלות בעיקר בכעשר שפות מרכזיות שזכו לנפח אימון משמעותי.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.1 גיגה בייט, מה שמאפשר להריץ אותו ישירות דרך ספריית transformers גם על CPU רגיל במחשב פיתוח, ללא מאיץ גרפי ייעודי. ברירת המחדל עובדת על מקטעים של עד 30 שניות, וכדי לתמלל הקלטות ארוכות מפעילים את מנגנון החלוקה למקטעים של הצינור הרשמי.

אם אתם צריכים תמלול שוטף במערכת עמוסה או דיוק גבוה בשפות שאינן אנגלית, הרצה עצמית של הגודל הזה תדרוש פשרות באיכות. במקרים של עומסים כבדים או צורך בדיוק מרבי, שימוש בממשק מרוחק של הגרסאות הגדולות יחסוך את כאב הראש של תחזוקת שרתים.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="openai/whisper-base")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מעניק חופש מלא לשימוש מסחרי, שינוי הקוד והפצה פנימית או חיצונית בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗