GPT
F

faster-whisper-large-v2

קוד פתוח

Systranmit2023-11-23

  • ctranslate2
  • audio
  • automatic-speech-recognition
  • en
  • zh

זו גרסה מומרת של מודל התמלול הגדול של OpenAI שמיועדת למנוע CTranslate2. המטרה כאן היא לקבל תמלול ברמת Large בלי לשלם את מלוא מחיר המהירות והמשאבים.

  • 2.9 GBמשקל הקבצים
  • 112,471הורדות בחודש
  • 48לייקים

מה זה

מדובר בהמרה של openai/whisper-large-v2 לפורמט של CTranslate2, שנועדה לעבוד ישירות עם ספריית faster-whisper. המודל מבצע זיהוי דיבור אוטומטי ותומך במספר שפות מרכזיות כמו אנגלית, ספרדית, צרפתית, גרמנית, רוסית, סינית, יפנית וקוריאנית. המשקל שלו עומד על 2.9 ג'יגה בייט בשישה קבצים, הודות לדחיסה הראשונית בפורמט float16.

במקום להריץ את המודל המקורי דרך פייתורץ' הכבד, ההמרה הזו מיועדת לחישוב ממוטב ויעיל יותר בזמן ריצה. החבילה לא כוללת ארכיטקטורה חדשה או אימון מחודש על דאטה אחר, אלא נטו מימוש מהיר של אותו מודל מוכר, שמיועד לחסוך זמני עיבוד בשרת.

מתאים ל

  • תמלול מהיר בשרת עצמאי

    הספרייה של ctranslate2 מורידה משמעותית את זמני הריצה בהשוואה למודל המקורי.

  • הפקת כתוביות עם חותמות זמן

    המודל פולט זמני התחלה וסיום מדויקים לכל מקטע שמתומלל מתוך הקובץ.

  • תמלול הקלטות בשפות נתמכות

    מתאים במיוחד לעבודה עם שפות מרכזיות כמו אנגלית, ספרדית או גרמנית.

איפה זה נופל

הכרטיס לא מציג מדדי ביצועים חדשים ומפנה ישירות למודל המקורי של OpenAI, כך שכל נקודות התורפה של המודל המקורי נשארות כאן. בנוסף, רשימת השפות המצוינת כוללת שפות נפוצות בלבד, ועברית לא מופיעה ביניהן. שווה לבדוק בעצמכם איך הוא מתמודד עם השפה שלכם לפני שאתם בונים עליו למערכת פעילה.

אותה משפחה

faster-whisper-large יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מעבד רגיל בלי כרטיס מסך?

כן, המנוע של CTranslate2 תומך בריצה על מעבד ומאפשר להגדיר דיוק מופחת כמו int8 דרך compute_type. הביצועים יהיו איטיים יותר מאשר על כרטיס מסך, אבל זה יחסוך את הצורך בחומרה ייעודית יקרה.

האם המודל שונה בדיוק שלו מהמודל המקורי של OpenAI?

לא, המשקלים הומרו ישירות מהמודל המקורי בפורמט float16 בלי אימון מחדש. רמת הדיוק והתמלול זהה למקור, וההבדל היחיד הוא במנוע ההרצה ובמהירות.

איך מריצים

כדי להריץ אותו מייבאים את WhisperModel מתוך faster-whisper ומגדירים את הזיהוי על קובץ האודיו. המשקלים שמורים בפורמט float16, מה שדורש כרטיס מסך עם מספיק זיכרון וידאו, אבל אפשר לשנות את סוג החישוב באמצעות האפשרות compute_type בזמן הטעינה כדי להתאים לחומרה חלשה יותר או למעבד רגיל.

אם יש לכם כרטיס מסך פנוי ותעבורת אודיו קבועה, שווה להרים אותו לבד. אם מדובר בכמויות קטנות או ספורדיות של הקלטות, אולי עדיף להשתמש ב־API מוכן במקום להחזיק שרת דלוק באוויר.

pip install -U huggingface_hub
hf download Systran/faster-whisper-large-v2

הקבצים

6 קבצים במאגר, 2.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון MIT. הוא מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד והפצה של המודל כחלק ממוצר שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗