GPT
W

whisper-tiny.en

קוד פתוח

openaiapache-2.02022-09-26

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

גרסת תמלול זעירה ומהירה במיוחד באנגלית בלבד. היא מיועדת למי שחייב מודל קל משקל שרץ מקומית בלי כרטיס מסך כבד ומסתפק בדרישות דיוק צנועות.

  • 38Mפרמטרים
  • 580 MBמשקל הקבצים
  • 239,171הורדות בחודש
  • 121לייקים

מה זה

מדובר בגרסה הכי קטנה במשפחת המודלים של החברה, והיא מאומנת לתמלל דיבור באנגלית בלבד. הארכיטקטורה מבוססת על sequence-to-sequence עם 4 שכבות וסך הכל כ־38 מיליון פרמטרים. האימון הכללי של הפרויקט נעשה על 680 אלף שעות של הקלטות עם תיוג חלש שנאספו מהרשת, שמתוכן כ־438 אלף שעות היו באנגלית.

היתרון המרכזי כאן הוא חסכון עצום במשאבים. המודל שוקל 580 מגה בייט בלבד, ולכן הוא עולה ונשאר בזיכרון בקלות בהשוואה לגרסאות הגדולות שמגיעות למעל מיליארד פרמטרים. מצד שני, בגלל הגודל המזערי הוא פחות מדויק מהאחים הגדולים שלו, במיוחד כשיש מבטאים מורכבים או רעשי רקע חזקים.

מתאים ל

  • תמלול באנגלית במכשיר קצה

    הוא שוקל 580 מגה בייט ורץ בקלות על מעבד סטנדרטי בלי תלות באינטרנט.

  • יצירת כתוביות לסרטונים

    הוא תומך בחלוקה למקטעים ויודע להחזיר חותמות זמן ישירות לכל קטע קול.

  • פקודות קוליות למערכות

    זמני התגובה שלו מהירים מאוד בגלל מספר הפרמטרים הנמוך שלו.

איפה זה נופל

הוא לא מבין עברית בכלל ולא יודע לתרגם, מדובר במודל לאנגלית בלבד. בגלל האימון על דאטה רועש מהרשת, המודל נוטה להזיות ולפעמים ממציא מילים שלא נאמרו בקובץ מתוך ניסיון לנחש את המילה הבאה במשפט. בנוסף, המבנה שלו גורם לו לעיתים לחזור בלולאות על אותם משפטים שוב ושוב. הוא לא מתאים בשום אופן לקבלת החלטות קריטיות, לא מזהה מי הדובר, ומראה ירידה מורגשת בדיוק כשיש מבטאים כבדים.

שאלות
נפוצות

האם המודל תומך בתמלול שיחות בעברית?

לא. גרסה זו כוללת את הסיומת en ואומנה אך ורק על השפה האנגלית. בשביל עברית צריך לבחור בגרסאות הרב לשוניות של הפרויקט, וגם שם מומלץ לבדוק את הביצועים מראש.

מה אפשר לעשות אם המודל נתקע וחוזר על אותו משפט?

כרטיס המודל מציין שהתופעה הזו מוכרת במבנה הזה. הם ממליצים לשלוט בזה בעזרת כיוונון של beam search והגדרות טמפרטורה בזמן הדגימה, אם כי זה לא פותר את הבעיה לחלוטין.

איך מריצים

טוענים את המודל ישירות דרך ספריית transformers בפייתון בעזרת מעבד הקלט WhisperProcessor ופייפליין לתמלול. הוא תוכנן במקור לקטעים של עד 30 שניות, אבל הפייפליין תומך בחלוקה למקטעים וכך אפשר להעביר קבצים בכל אורך ואפילו להוציא חותמות זמן מדויקות למילים.

מבחינת חומרה, המשקל הנמוך של הקבצים מאפשר להריץ אותו בלי שום בעיה על מעבד רגיל, לפטופ פשוט או שרת ענן בסיסי, בלי להחזיק כרטיס גרפי ייעודי. שווה להחזיק אותו מקומית אם רוצים לחסוך עלויות שוטפות או לשמור על פרטיות. אם אתם צריכים דיוק גבוה בהרבה באנגלית או שפות נוספות, פנייה לגרסאות הגדולות יותר תחסוך כאב ראש.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="openai/whisper-tiny.en")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗