GPT
F

faster-distil-whisper-large-v3

קוד פתוח

Systranmit2024-03-25

  • ctranslate2
  • audio
  • automatic-speech-recognition
  • en

גרסה מכווצת ומואצת לתמלול אודיו שמיועדת לרוץ מהר על מנוע CTranslate2. היא חוסכת משאבים ביחס למודל המקורי, כל עוד מדובר באנגלית בלבד.

  • 1.4 GBמשקל הקבצים
  • 49,043הורדות בחודש
  • 70לייקים

מה זה

מדובר בהמרה של המודל distil-whisper-large-v3 למבנה של ספריית CTranslate2, שמוכרת בעיקר דרך faster-whisper. המטרה כאן פשוטה: לקחת את התמלול של וויספר בגודל לארג', שמזוקק לרשת קלה יותר, ולהריץ אותו במנוע שמקצץ את זמני החישוב וצריכת הזיכרון. המשקל הכולל של הקבצים עומד על 1.4 גיגה בייט בלבד, מה שהופך את ההורדה והטעינה שלו למהירות מאוד בהשוואה למודלים מלאים בגודל הזה.

המשקלים נשמרו בפורמט float16, שזה הסטנדרט המקובל להרצה מהירה על כרטיסי מסך בלי לאבד דיוק מורגש. המודל מתמקד במשימת זיהוי דיבור אוטומטי ומכוון ספציפית לשפה האנגלית. מי שמחפש אלטרנטיבה למודל המקורי של OpenAI יקבל כאן קובץ קל משמעותית שלא דורש התקנה כבדה של ספריות פייתורץ' סטנדרטיות, אלא נשען ישירות על מנוע ההסקה של CTranslate2.

מתאים ל

  • תמלול שיחות באנגלית

    מתאים לשרתי בקאנד שמקבלים הקלטות קוליות באנגלית וצריכים להחזיר טקסט בזמן קצר עם צריכת זיכרון נמוכה.

  • יצירת כתוביות לסרטונים

    מפיק חלוקה למקטעים עם זמני התחלה וסיום מדויקים באנגלית, מה שמאפשר לייצר קובצי תזמון במהירות על מעבד סביר.

  • מערכות עיבוד מקומיות

    משקל של 1.4 גיגה בייט מאפשר לארוז אותו בקלות בתוך קונטיינר קטן ולהריץ תמלול על חומרה מקומית ללא חיבור רשת.

איפה זה נופל

החיסרון הברור והמרכזי הוא השפה. המודל מאומן ותומך אך ורק באנגלית, כך שהוא חסר תועלת לחלוטין עבור אודיו בעברית, בערבית או בכל שפה אחרת. אם תזינו לו הקלטה בעברית תקבלו ג'יבריש או ניסיון שגוי לתמלל פונטית לאותיות לטיניות. מעבר לזה, הכרטיס לא מציג נתוני שגיאה רשמיים משלו אלא מפנה לכרטיס המקורי, ולכן צריך לבדוק אותו עצמאית על הקלטות עם רעשי רקע לפני שמשלבים אותו במערכת אמיתית.

שאלות
נפוצות

האם המודל תומך בתמלול הקלטות בעברית?

לא, המודל מיועד אך ורק לשפה האנגלית. שדות המידע מציינים מפורשות en בלבד, ולכן הוא אינו מסוגל לעבד עברית. לתמלול בעברית תצטרכו להשתמש במודל וויספר רב־לשוני רגיל.

האם חייבים כרטיס מסך כדי להריץ את המודל?

לא חייבים כרטיס מסך ייעודי. CTranslate2 מייעלת מאוד את פעולת המעבד, כך שאפשר להריץ אותו גם על מעבדים רגילים, אם כי שימוש בכרטיס מסך ייתן זמני תמלול מהירים בהרבה.

איך מריצים

כדי להריץ אותו משתמשים בספריית faster-whisper או ישירות ב־CTranslate2 בפייתון. טוענים את המודל distil-large-v3 ומעבירים קובץ שמע לפונקציית התמלול, כאשר מומלץ לקבוע את השפה מראש כ־en ולכבות התניה על טקסט קודם. בגלל גודל של 1.4 גיגה בייט, כרטיס מסך בסיסי עם 4 עד 6 גיגה בייט של זיכרון יריץ אותו בלי להזיע.

המשקלים מגיעים ב־float16, אבל אפשר להמיר את סוג החישוב בזמן הטעינה בעזרת האפשרות compute_type, למשל לחישובים קלים יותר. שווה להחזיק שרת עצמאי אם יש לכם זרם קבוע של אודיו באנגלית וצריך תגובה מיידית בלי תשלום לפי דקה. אם מדובר בכמה שעות שמע בודדות בחודש, סביר שעדיף להישאר עם API חיצוני ולא לתחזק שרת.

pip install -U huggingface_hub
hf download Systran/faster-distil-whisper-large-v3

הקבצים

7 קבצים במאגר, 1.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שאומר חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להפיץ אותו מחדש או לשלב אותו במוצר סגור בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית והרישיון בתוך התוכנה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗