GPT
K

kotoba-whisper-v2.0

קוד פתוח

kotoba-techapache-2.02024-09-17

  • transformers
  • safetensors
  • whisper
  • automatic-speech-recognition
  • audio

תמלול דיבור ביפנית שמספק ביצועים קרובים למודל הענק של OpenAI אבל רץ פי שישה מהר יותר. הפתרון מיועד למי שחייב מהירות תגובה גבוהה ביפנית בלי לשלם על שרתים מנופחים.

  • 756Mפרמטרים
  • 1.4 GBמשקל הקבצים
  • 10,377הורדות בחודש
  • 98לייקים

מה זה

מדובר בגרסה מזוקקת של Whisper large-v3 שתוכננה ספציפית עבור השפה היפנית. הארכיטקטורה שומרת על הקידוד המלא של מודל המקור אבל מכווצת את המפענח לשתי שכבות בלבד, מה שמוריד את מספר הפרמטרים ל־756 מיליון ומאיץ את העבודה פי 6.3 בהשוואה למודל המקורי.

האימון נעשה על בסיס נתוני ReazonSpeech שחולצו מהקלטות טלוויזיה יפניות בהיקף של יותר משבעה מיליון מקטעים. במבחני שגיאות תווים על המאגר הזה, הוא עוקף את המקור של OpenAI עם 11.6 לעומת 14.9, בעוד שבמאגרי בדיקה חיצוניים כמו CommonVoice ו־JSUT הוא מציג דיוק קרוב מאוד למודל המלא.

מתאים ל

  • תמלול שידורי וידאו ביפנית

    הוא הוכשר על הקלטות טלוויזיה ומצטיין בזיהוי דיבור שוטף בתוכן מדיה.

  • תמלול שיחות בזמן אמת

    מהירות ריצה גבוהה פי 6.3 שמאפשרת להחזיר פלט כמעט ללא השהיה.

  • הרצה על חומרה מקומית וקצה

    משקל קל של 1.4 גיגה־בייט שמתאים להרצה חלקה על כרטיסי מסך קטנים.

איפה זה נופל

הוא יודע לעבוד אך ורק עם השפה היפנית. כל ניסיון לתמלל באמצעותו עברית, אנגלית או שפות אחרות ייכשל לחלוטין. בנוסף, אף על פי שהוא מתעלה על מודל המקור בבדיקות של תוכן טלוויזיוני שעליו הוא אומן, במבחני תמלול חיצוניים כמו JSUT שיעור שגיאות התווים שלו מעט פחות טוב מזה של Whisper large-v3. המודל גם דורש שמע בקצב דגימה של 16 קילו־הרץ, כך שחובה להמיר קבצים לפני ההזנה.

אותה משפחה

kotoba-whisper יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לתמלול עברית?

לא. מדובר במודל שזוקק ואומן באופן ייעודי לשפה היפנית בלבד. הוא אינו מזהה עברית או שפות אחרות.

איך הוא מתמודד עם קובצי אודיו ארוכים?

הוא תומך בשני מצבים דרך הקוד. מצב עוקב שמספק דיוק מרבי, או מצב חלוקה למקטעים שמקצר את זמן העיבוד בעד פי תשעה.

במה הוא עדיף על Whisper large-v3 המקורי?

הוא שוקל חצי ממנו, תופס פחות זיכרון, ורץ במהירות גבוהה פי שישה, תוך שמירה על דיוק דומה מאוד ביפנית.

איך מריצים

טוענים את המשקלים דרך ספריית transformers מגרסה 4.39 ומעלה בפורמט bfloat16, תוך שימוש בצינור התמלול הרגיל. קובצי המודל שוקלים 1.4 גיגה־בייט בלבד, כך שכל כרטיס מסך ביתי עם 6 עד 8 גיגה זיכרון מריץ אותו מקומית בלי מאמץ. למי שמחפש ביצועים נוספים, יש גרסאות מותאמות לספריות faster-whisper ו־whisper.cpp, וכן תמיכה בהאצת Flash Attention 2.

בקריאות לקבצים ארוכים יש בחירה בין אלגוריתם עוקב שמדייק יותר לבין חלוקה למקטעים של 25 שניות שמקצרת את זמן הריצה עד פי תשעה. אם אין ברשותכם חומרה ייעודית בכלל והנפח שלכם נמוך מכמה שעות בחודש, עדיף לצרוך שירותי ענן קיימים במקום לתחזק שרת.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="kotoba-tech/kotoba-whisper-v2.0")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי חופשי, שינוי קוד והפצה פנימית או חיצונית. מותר לשלב אותו במוצרים סגורים בלי לחשוף קוד, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗