GPT
F

faster-whisper-medium

קוד פתוח

Systranmit2023-11-23

  • ctranslate2
  • audio
  • automatic-speech-recognition
  • en
  • zh

הסבה מוכנה של מודל התמלול לרמת דיוק בינונית, שעברה אופטימיזציה לספריית CTranslate2. הוא מיועד למי שרוצה תמלול מהיר בלי לשרוף משאבים מיותרים.

  • 1.4 GBמשקל הקבצים
  • 675,873הורדות בחודש
  • 63לייקים

מה זה

מדובר בהמרה ישירה של המודל medium המקורי מבית OpenAI לפורמט של CTranslate2. המודל מתמקד בזיהוי דיבור אוטומטי ומיועד לעבודה ישירה מול ספריית faster-whisper, במטרה לספק ביצועים מהירים יותר וצריכת זיכרון נמוכה בהרבה לעומת הקוד המקורי של פייתורץ'. המשקל הכולל יושב על 1.4 גיגה בייט בלבד, מה שהופך את כל תהליך הפריסה לקל ונגיש.

רשימת השפות המוגדרת כוללת אנגלית, סינית, גרמנית, ספרדית, רוסית, קוריאנית, צרפתית ויפנית. המשקלים נשמרו בדיוק של float16 באמצעות כלי ההמרה הרשמי, כך שמקבלים את רמת הדיוק של גרסת ה־medium הסטנדרטית בלי התקורה הכבדה של מודלים גדולים יותר. אם אתם צריכים תמלול שוטף לשפות הנתמכות, הוא נותן פשרה מאוזנת מאוד בין איכות למהירות.

מתאים ל

  • תמלול קבצי שיחה

    טוב לעיבוד מהיר של הקלטות בשפות הנתמכות בזכות משקל קל של 1.4 גיגה בייט.

  • יצירת כתוביות לסרטונים

    הקוד מחזיר נקודות זמן מדויקות לכל מקטע, מה שמתאים לייצור קובצי טקסט מסונכרנים.

  • תמלול שרת עצמאי

    מתאים למי שמחפש חלופה מקומית ומהירה לספריות כבדות בלי תלות בשירותי ענן חיצוניים.

איפה זה נופל

הכרטיס לא מציג נתוני שגיאה, השוואות דיוק מול המקור או מבחני ביצועים רשמיים, אלא רק את פקודת ההמרה הטכנית. בנוסף, עברית כלל אינה מופיעה ברשימת השפות של המודל, מה שאומר שחובה לבדוק אותו עצמאית לפני שבונים עליו למוצר מקומי. אין כאן מנגנונים מתקדמים שנוספו מעבר למה שהיה במקור.

שאלות
נפוצות

האם המודל תומך בעברית?

עברית אינה מופיעה ברשימת השפות שפורסמה בדף המודל. אם המטרה היא תמלול עברי, צריך להריץ בדיקה עצמאית על קבצים אמיתיים או לחפש גרסה אחרת.

האם חייבים כרטיס מסך כדי להריץ אותו?

לא חובה, המנוע של CTranslate2 יודע לעבוד גם על מעבדים רגילים. עם זאת, המשקלים שמורים בפורמט float16, ועל מעבד ייתכן שתרצו לשנות את אופן החישוב בזמן הטעינה.

איך מריצים

כדי להריץ אותו מייבאים את WhisperModel מתוך faster-whisper ומגדירים את שם המודל, ואז מעבירים קובץ שמע ישירות לפונקציית התמלול. המשקלים שמורים בפורמט float16, אך המנוע מאפשר לשנות את הדיוק בזמן הטעינה בעזרת הגדרת compute_type כדי להתאים לחומרה שלכם.

משקל הקבצים עומד על 1.4 גיגה בייט, כך שכרטיס מסך מודרני ממוצע יחזיק אותו בלי בעיה. אם אין לכם מעבד גרפי ייעודי ואתם מתכננים לעבד נפחי אודיו עצומים בזמן אמת, עדיף לפנות ל־API מנוהל כדי לא לחנוק את השרת.

pip install -U huggingface_hub
hf download Systran/faster-whisper-medium

הקבצים

6 קבצים במאגר, 1.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שאומר חופש כמעט מוחלט. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, להפיץ אותו ולהריץ אותו באופן פרטי, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗