GPT
F

guillaumekln/faster-whisper-large-v2

קוד פתוח

guillaumeklnmit2023-03-23

  • ctranslate2
  • audio
  • automatic-speech-recognition
  • en
  • zh

זו גרסת large-v2 של וויספר שעברה המרה למנוע CTranslate2. היא נועדה לתמלל אודיו מהר יותר ועם פחות זיכרון ממה שהקוד המקורי של OpenAI דורש.

  • 2.9 GBמשקל הקבצים
  • 9,177הורדות בחודש
  • 213לייקים

מה זה

מדובר בהמרה של המודל המקורי מבית OpenAI לפורמט שמתאים ישירות לספריית CTranslate2, שהיא מנוע הסקה מותאם ויעיל במיוחד. המודל מבצע תמלול אוטומטי של קובצי קול ומחזיר טקסט יחד עם נקודות זמן מדויקות לכל מקטע בדיבור. המרת המשקלים נעשתה מראש לדיוק של חצי צף, מה שמקטין את הנפח על הדיסק ואת צריכת הזיכרון ברגע הטעינה.

היתרון הגדול מול המימוש המקורי בפייתורץ' נוגע ישירות לקצב העבודה ולמשאבים. במקום לסחוב סביבה כבדה, מריצים אותו דרך חבילת faster-whisper ומקבלים ביצועי תמלול מהירים בהרבה על אותה חומרה בדיוק. המודל שומר על יכולות הדיוק הגבוהות של הגרסה הגדולה, אך מנגיש אותן לתשתיות שלא יכלו להחזיק את המקור ביציבות.

מתאים ל

  • תמלול מהיר על שרתים עצמאיים

    מנוע CTranslate2 מאיץ את הקצב ומאפשר לעבד כמויות גדולות של קול בלי להחזיק חומרה יקרה מדי.

  • יצירת כתוביות לסרטונים

    המודל מחזיר חותמות זמן מדויקות לתחילת וסוף כל משפט, מה שמקל על יצירה ישירה של קובצי כתוביות.

  • מערכות לניתוח שיחות בשפות נתמכות

    מתאים לחילוץ טקסט באנגלית ושפות מרכזיות נוספות כדי להזין מערכות עיבוד שפה וחיפוש.

איפה זה נופל

המודל הומר מראש לשמונה שפות עיקריות שמופיעות במפרט, ביניהן אנגלית, סינית, ספרדית, גרמנית, רוסית, קוריאנית, צרפתית ויפנית. עברית אינה מופיעה ברשימת השפות המוגדרות של ההמרה הזו, ולכן אם המטרה היא תמלול בעברית, חובה לבדוק את התוצאות בפועל לפני שמסתמכים עליו בייצור. מעבר לזה, המודל דורש התקנה ותלות בספריית CTranslate2 ולא יעבוד ישירות מתוך הספריות המקוריות של וויספר.

שאלות
נפוצות

האם המודל הזה מתאים לתמלול של שיחות בעברית?

עברית לא מצוינת בין השפות הרשמיות של ההמרה הזו. כדאי להריץ בדיקה על כמה קבצים לדוגמה כדי לוודא אם רמת הזיהוי מספיקה לצרכים שלכם, או שנדרש מודל ייעודי אחר.

מה ההבדל בין המודל הזה לגרסה הרגילה של וויספר?

המשקלים עברו אופטימיזציה לספריית CTranslate2 ונשמרו בדיוק חצי צף. התוצאה היא צריכת זיכרון נמוכה יותר ומהירות עבודה גבוהה משמעותית בהשוואה למימוש המקורי בפייתורץ'.

איך מריצים

כדי להריץ אותו מתקינים את faster-whisper וטוענים את המודל בכמה שורות פייתון פשוטות. המשקלים תופסים כמעט 3 גיגה בייט בדיסק, כך שצריך כרטיס מסך עם זיכרון סביר שתומך בהרצה מהירה של חצי צף, או מעבד חזק אם בוחרים להריץ על הברזלים של השרת בלי מאיץ ייעודי.

המנוע מאפשר לשנות את סוג החישוב בזמן הטעינה כדי לחסוך זיכרון נוסף. אם יש לכם שרת עצמאי עם נפח תמלול קבוע וגבוה, שווה לגמרי להחזיק את התשתית הזו בעצמכם במקום לשלם לפי דקת תמלול לשירותים חיצוניים.

pip install -U huggingface_hub
hf download guillaumekln/faster-whisper-large-v2

הקבצים

6 קבצים במאגר, 2.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. המשמעות פשוטה: אפשר לקחת אותו, לשלב אותו בתוך מוצר מסחרי, להריץ אותו בשרתים פרטיים או לשנות אותו כרצונכם, ללא צורך בתשלום תמלוגים ובלי לפתוח את קוד המקור של המוצר שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗