GPT
F

faster-whisper-large-v3-turbo-ct2

קוד פתוח

deepdmlmit2024-10-01

  • ctranslate2
  • audio
  • automatic-speech-recognition
  • en
  • zh

הסבה מוכנה של גרסת הטורבו לפורמט CTranslate2 שרצה מהר במיוחד. מי שרוצה תמלול דיבור מדויק וקל יחסית בלי להסתבך עם המרה ידנית ימצא כאן פתרון מיידי.

  • 1.5 GBמשקל הקבצים
  • 94,091הורדות בחודש
  • 223לייקים

מה זה

מדובר בהמרה של דגם whisper-large-v3-turbo של OpenAI לפורמט CTranslate2. המטרה של המהלך הזה היא לחסוך עבודה ולתת לכם קבצים שמוכנים ישר להרצה עם ספריית faster-whisper. כל המשקל שלו יושב על 1.5 גיגה בייט בלבד, כך שמקבלים ביצועים של דגם גדול בלי לשלם בנפח עצום או בזמני טעינה ארוכים.

המודל מיועד לתמלול אודיו לשמונה שפות עיקריות שרשומות במפרט, ביניהן אנגלית, ספרדית, גרמנית, צרפתית ורוסית. מכיוון שהוא מומר מראש לדיוק FP16, הוא מיועד למי שצריך תפוקה גבוהה וזמני תגובה קצרים בתמלול קבצים או שיחות, תוך שמירה על רמת הדיוק של גרסת הטורבו המקורית.

מתאים ל

  • תמלול הקלטות באנגלית

    הסבה מותאמת שרצה מהר עם faster-whisper ומאפשרת לפרוק שעות של פודקאסטים או שיחות באנגלית בלי לחנוק את החומרה.

  • פייפליין מקומי בריבוי שפות

    מתאים לשרת פנימי שמתמלל קבצים בגרמנית, ספרדית או רוסית במהירות גבוהה ובנפח דיסק זעום של 1.5 גיגה בייט.

  • שילוב במוצר מסחרי

    רישיון MIT חופשי לחלוטין מאפשר לשלב את התמלול ישירות באפליקציה שלכם בלי לחשוש מבעיות משפטיות.

איפה זה נופל

הבעיה הבולטת ביותר היא היעדר עברית מרשימת השפות הרשמיות של הדגם. הרשימה כוללת שמונה שפות בלבד, ולכן אם המטרה שלכם היא לתמלל שיחות מקומיות, רוב הסיכויים שתקבלו ג'יבריש או דילוגים על מילים. בנוסף, כרטיס המודל לא חושף נתוני שגיאות או צריכת זיכרון בפועל מול גרסת הבסיס, אלא רק מסביר איך בוצעה ההמרה הטכנית, כך שאתם חייבים לבדוק בעצמכם את איכות התוצאות מול הדרישות שלכם.

שאלות
נפוצות

האם אפשר להריץ את הדגם הזה על מעבד רגיל בלי כרטיס מסך?

כן. מנוע CTranslate2 בנוי להרצה יעילה גם על גבי CPU. בעזרת שינוי פרמטר החישוב בזמן הטעינה, אפשר לקבל זמני תמלול סבירים גם בלי מאיץ גרפי ייעודי.

האם המודל תומך בתמלול שיחות בעברית?

רשימת השפות הרשמית כוללת אנגלית, סינית, גרמנית, ספרדית, רוסית, קוריאנית, צרפתית ויפנית בלבד. עברית לא מצוינת שם, כך שלא כדאי לבנות עליו לפרויקטים מקומיים.

איך מריצים

טוענים את המשקלים ישירות דרך הספרייה faster-whisper בקוד פייתון פשוט ומריצים את פונקציית התמלול על קובץ קול. המשקלים שמורים כרגע בדיוק של 16 ביט, אבל המנוע של CTranslate2 יודע לבצע כימות נוסף בזמן הטעינה בעזרת הפרמטר compute_type, כך שאפשר להריץ אותו גם על כרטיסי מסך צנועים יותר או אפילו על מעבדים סטנדרטיים.

עם נפח של גיגה וחצי הוא לא דורש שרתים מפלצתיים. אם יש לכם כרטיס מסך מודרני מקומי, שווה להריץ אותו לבד ולא לשלם לספקי ענן לפי דקת שמע, בייחוד אם אתם מעבדים כמויות גדולות של קבצים באופן שוטף.

pip install -U huggingface_hub
hf download deepdml/faster-whisper-large-v3-turbo-ct2

הקבצים

7 קבצים במאגר, 1.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון MIT. מותר לכם לעשות איתו כמעט הכל, כולל שילוב במוצרים מסחריים סגורים ומכירה שלהם, בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצי הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗