GPT
K

kb-whisper-large

קוד פתוח

KBLabapache-2.02025-02-14

  • transformers
  • onnx
  • safetensors
  • whisper
  • automatic-speech-recognition

זהו שחזור שוודי ייעודי למודל התמלול הגדול של וויספר, שמיועד למי שחייב דיוק מרבי בשוודית. אם שפת המקור שלכם היא עברית או אנגלית, אין לכם מה לחפש כאן.

  • 1.6Bפרמטרים
  • 46.2 GBמשקל הקבצים
  • 70,165הורדות בחודש
  • 67לייקים

מה זה

הספרייה הלאומית של שוודיה אימנה מחדש את הארכיטקטורה המוכרת של Whisper על יותר מ־50,000 שעות שמע בשוודית. המטרה כאן ממוקדת לגמרי: להביא את רמת הדיוק בשוודית למקום שהמודל הרב-לשוני הרגיל לא הגיע אליו.

התוצאות במבחנים מראות שיפור מעשי. במבחן CommonVoice למשל, שיעור שגיאות המילים יורד מ־9.5 אחוזים במודל המקורי של OpenAI ל־4.1 אחוזים בלבד כאן. זה אומר פחות מחצי מכמות שגיאות התמלול בטקסט הסופי. הם גם בנו שתי גרסאות התנהגות שונות לאותו גודל: אחת בשם subtitle שמייצרת טקסט מהודק שמתאים לכתוביות, ואחת בשם strict שמתמללת מילה במילה בדיוק מוחלט.

מתאים ל

  • תמלול ארכיונים בשוודית

    הוא מציג 4.1 אחוזי שגיאה בלבד ב־CommonVoice, ומספק את הדיוק הגבוה ביותר שקיים כיום לשפה זו.

  • הפקת כתוביות לטלוויזיה

    גרסת ה־subtitle המובנית חותכת מילים מיותרות ומייצרת טקסט קריא שמותאם ישירות לפורמט מסך.

  • פרוטוקולים משפטיים

    גרסת ה־strict מתמללת באופן מילולי ומדויק כל הברה שנאמרה בהקלטה, ללא קיצורי דרך בניסוח.

איפה זה נופל

ההגבלה הראשונה והברורה ביותר היא השפה. המודל הוגדר ואומן עבור שוודית בלבד, כך שהוא לא יעזור לכם בכלל בתמלול עברית או אנגלית. שנית, מדובר במודל הכבד ביותר בסדרה, והפער בביצועים מול גרסת ה־medium או אפילו ה־small שלהם אינו ענק: ב־CommonVoice גרסת ה־small עומדת על 6.4 אחוזי שגיאה לעומת 4.1 כאן, פער שלא תמיד מצדיק את תוספת הזיכרון והאיטיות בחומרה מוגבלת.

שאלות
נפוצות

האם כדאי להשתמש בו לתמלול שיחות בעברית?

לא. המודל עבר אימון ייעודי על מאגרי שמע שוודיים בלבד. להקלטות בעברית תצטרכו להישאר עם המודל הרב-לשוני המקורי או לחפש מודלים שעברו כוונון לעברית.

איזו גרסת משקלים כדאי לטעון בקוד?

זה תלוי במטרה. לשימוש רגיל ברירת המחדל עובדת היטב, אבל אם אתם בונים כתוביות לסרטונים כדאי להעביר revision שווה subtitle, ועבור תמלול ישיבות שחייב דיוק מוחלט בכל מילה עדיף להגדיר revision שווה strict.

האם אני חייב כרטיס מסך יקר בשביל להריץ אותו?

כדי להריץ אותו במהירות סבירה ב־float16 אכן צריך כרטיס מסך עם 8 עד 10 גיגה זיכרון לפחות. אם אין לכם חומרה כזו, אפשר להוריד את קובץ ה־GGML המכווץ ולהריץ אותו דרך מעבד רגיל ב־whisper.cpp, אם כי הביצועים יהיו איטיים יותר.

איך מריצים

כדי להריץ מודל עם 1.6 מיליארד פרמטרים בדיוק float16 תצטרכו כרטיס מסך עם לפחות 8 עד 10 גיגה-בייט של זיכרון גרפי ייעודי רק למשקלים, לפני שלוקחים בחשבון את זיכרון העבודה של ההסקה. אם אין לכם חומרה כזו בשרת, תשלום לפי דקה ל־API חיצוני עדיף בהרבה על החזקת מכונה כבדה שפועלת סביב השעון.

מי שכן מריץ מקומית לא חייב להישאר בספריית transformers הכבדה. המפתחים שחררו מראש קבצים מותאמים ל־faster-whisper שמבוסס על ctranslate2, גרסאות מכווצות בפורמט GGML לשימוש ב־whisper.cpp, וגם קובצי onnx אם רוצים לדחוף את ההרצה לצד לקוח בדפדפן.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="KBLab/kb-whisper-large")
print(pipe("שלום"))

הקבצים

53 קבצים במאגר, 46.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש מלא. אתם רשאים להריץ אותו, לשנות אותו, להטמיע אותו במוצר מסחרי סגור או פתוח, ולמכור שירותים שמבוססים עליו, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗