GPT
F

faster-whisper-large-v3

קוד פתוח

Systranmit2023-11-23

  • ctranslate2
  • audio
  • automatic-speech-recognition
  • en
  • zh

הסבה ישירה של וויספר הגדול למנוע ההרצה CTranslate2. מקבלים את רמת הדיוק של המודל המקורי, אבל במהירות גבוהה יותר ובצריכת זיכרון נמוכה בהרבה.

  • 2.9 GBמשקל הקבצים
  • 1,105,706הורדות בחודש
  • 657לייקים

מה זה

מדובר בהמרה של openai/whisper-large-v3 לפורמט CTranslate2, שנועדה לעבוד ישירות עם ספריית faster-whisper או ישירות מעל CTranslate2 עצמה. המודל מתמקד בזיהוי דיבור אוטומטי ותמלול קבצי שמע. הוא מגיע במשקל כולל של כ־2.9 גיגה בייט המחולק לשבעה קבצים, כשהמשקלים שמורים מראש בדיוק של float16.

ההבדל המרכזי מול הגרסה הרשמית של OpenAI טמון במנוע שמריץ את החישובים בפועל. במקום להסתמך על קוד הפייתון והמודל הסטנדרטי ב־PyTorch, ההמרה ל־CTranslate2 מייעלת את השימוש במעבד ובכרטיסי מסך, ומאפשרת לשנות את רמת הקוונטיזציה בזמן הטעינה דרך המשתנה compute_type.

רשימת השפות המוגדרת בכרטיס כוללת אנגלית, סינית, גרמנית, ספרדית, רוסית, קוריאנית, צרפתית ויפנית. מי שצריך תמלול מדויק בלי התקורה הכבדה של מודל המקור יקבל פה את אותו הדיוק של large-v3 בפורמט שרץ מהר יותר בייצור.

מתאים ל

  • תמלול מהיר בשרת

    עיבוד אודיו בקצב גבוה בזכות האופטימיזציות של CTranslate2 בלי לוותר על איכות התמלול.

  • חילוץ טקסט עם חותמות זמן

    הפלט מספק מקטעים עם זמני התחלה וסיום מדויקים שמתאימים מיד לייצור כתוביות.

  • הרצה מקומית על מחשב פיתוח

    משקל של 2.9 גיגה בייט ב־FP16 מאפשר הרצה יעילה גם על חומרה עם משאבי זיכרון מוגבלים.

איפה זה נופל

הכרטיס לא מציג נתוני שגיאה או מדידות השוואתיות משל עצמו, ומפנה ישירות לכרטיס המקורי של OpenAI. מעבר לכך, עברית כלל אינה מופיעה ברשימת השפות שהוגדרה בכרטיס המודל, מה שמחייב בדיקה יסודית ומעשית של איכות התמלול בעברית לפני שמחליטים לשלב אותו במוצר.

אותה משפחה

faster-whisper-large יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

במה המודל הזה שונה מ־whisper-large-v3 הרגיל?

המשקלים הבסיסיים זהים לחלוטין למודל של OpenAI, אך הם הומרו למבנה מותאם של CTranslate2. זה אומר שהוא מיועד להרצה דרך ספריית faster-whisper ומספק ביצועים מהירים יותר וצריכת זיכרון יעילה יותר.

האם הוא מתאים לעבודה בעברית?

השפות שמצוינות במפורש במטא-דאטה של הכרטיס הן אנגלית, סינית, גרמנית, ספרדית, רוסית, קוריאנית, צרפתית ויפנית. עברית לא מצוינת שם, ולכן חובה לבדוק את התוצאות על קבצי שמע שלכם לפני שמסתמכים עליו.

איך מריצים

כדי להריץ אותו מייבאים את WhisperModel מתוך ספריית faster-whisper, טוענים את המודל בשם large-v3 ומעבירים קובץ שמע לפונקציה transcribe. המשקלים שמורים ב־float16, כך שצריך כרטיס מסך שמחזיק לפחות 3 עד 4 גיגה בייט של VRAM פנוי רק למודל עצמו, או להשתמש ב־compute_type מותאם אם רצים על המעבד.

אם יש לכם קבצים בודדים פעם בכמה ימים, התחזוקה של סביבת ריצה עם ספריות CTranslate2 עשויה להיות מיותרת, ועדיף פשוט לשלוח קריאה ל־API חיצוני. המודל הזה משתלם כשמתמללים נפח קבוע של שמע ומחפשים זמני ריצה קצרים על תשתית מקומית או בשרת משלכם.

pip install -U huggingface_hub
hf download Systran/faster-whisper-large-v3

הקבצים

7 קבצים במאגר, 2.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו בשרתים פרטיים ולשלב אותו במוצרים סגורים בלי תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד או בהפצה של התוכנה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗