GPT
W

whisper-large-v3-turbo-german

קוד פתוח

primelineapache-2.02024-10-02

  • transformers
  • safetensors
  • whisper
  • automatic-speech-recognition
  • de

גרסה מכווננת של וויספר טורבו לתמלול גרמנית בדיוק גבוה. היא מיועדת למי שצריך תמלול מדויק ומהיר של שמע בגרמנית בלי לסחוב משקלים של מודל ענק.

  • 809Mפרמטרים
  • 1.5 GBמשקל הקבצים
  • 423,283הורדות בחודש
  • 65לייקים

מה זה

מדובר בהתאמה ממוקדת של ארכיטקטורת הטורבו עבור השפה הגרמנית, המבוססת על 32 שכבות ואימון ייעודי עם האופטימייזר Ademamix. במקום להשתמש במודל הכללי של OpenAI, המפתחים כיווננו אותו על מאגרי דיבור גרמניים כדי להוריד שגיאות פענוח במבטאים ומילים מקומיות.

במבחני השגיאות על פני כמה מאגרי נתונים, הגרסה הזו הגיעה לציון שגיאות מילים כולל של 2.628, תוצאה טובה יותר ממודל הבסיס של וויספר טורבו שהגיע ל־3.649, ואפילו טובה יותר מגרסת הלארג' v3 המקורית של OpenAI שעומדת על 3.279. במאגר multilingual librispeech הוא הציג שיעור שגיאה של 2.070, כך שמתקבלת איכות גבוהה משמעותית תוך שמירה על מהירות גבוהה.

מתאים ל

  • תמלול שיחות בגרמנית

    הוא מציג שיעור שגיאה נמוך של 2.628 במבחנים כוללים, מה שמבטיח פענוח מדויק של גרמנית מדוברת.

  • יצירת כתוביות לווידאו

    מבנה הטורבו מייצר תמלול מהיר שמתאים לעיבוד קבצי וידאו ארוכים בזמנים קצרים.

  • מערכות שליטה קולית

    משקל קל של גיגה וחצי מאפשר תגובה מהירה לפקודות קוליות בדיוק שמתאים לגרמנית.

איפה זה נופל

הכרטיס מצהיר על כיוונון בלעדי לשפה הגרמנית, מה שאומר שהוא לא מיועד לשפות אחרות. במבחני ההשוואה במאגר Tuda-De הוא קיבל ציון שגיאה של 6.441 לעומת מודל CrisperWhisper שהגיע ל־5.148, כך שהוא עדיין מתקשה יותר בהקשרים מסוימים. מעבר לזה, מדובר בפרויקט מחקר עצמאי ולא במוצר מסחרי נתמך, והאימון בוצע ללא הרחבת נתונים (Data augmentation), עובדה שמחייבת בדיקה על דגימות עם רעשי רקע לפני פריסה בייצור.

שאלות
נפוצות

האם המודל תומך בתמלול עברית או אנגלית?

לא. המודל עבר כיוונון ממוקד לשפה הגרמנית בלבד. אם תזינו לו שמע בעברית או באנגלית התוצאות יהיו שגויות או לא צפויות, ולמטרות אלו עדיף להשתמש בגרסת הטורבו המקורית.

במה הוא עדיף על וויספר לארג' v3 הרגיל?

הוא כולל 809 מיליון פרמטרים לעומת מעל מיליארד וחצי בגרסה המלאה, מה שמקצר משמעותית את זמן הריצה. במקביל, במבחני שגיאות המילים בגרמנית הוא הציג ציון כולל של 2.628 מול 3.279 של המודל הגדול.

איך מריצים

המשקל הכולל של הקבצים עומד על גיגה וחצי בפורמט bfloat16, כך שאפשר להריץ אותו דרך ספריית transformers על כרטיס מסך פשוט יחסית עם לפחות ארבעה עד שישה גיגה זיכרון וידאו. הגודל שלו, כ־809 מיליון פרמטרים, קל בהרבה מגרסת הלארג' המלאה שכוללת מיליארד וחצי פרמטרים.

אם נפח התמלול נמוך ולא מצדיק החזקת שרת ייעודי שפועל רצוף, פנייה ל־API מנוהל של שירותי ענן תהיה זולה ופשוטה יותר לתחזוקה. הרצה עצמית מתאימה בעיקר כשיש זרם שמע קבוע או דרישה לעיבוד מקומי.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="primeline/whisper-large-v3-turbo-german")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי מלא, שינוי הקוד והפצה מחדש. מותר לשלב אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗