GPT
N

nb-whisper-large

קוד פתוח

NbAiLabapache-2.02024-02-13

  • transformers
  • pytorch
  • jax
  • tensorboard
  • onnx

גרסה מכווננת של Whisper שהותאמה במיוחד לשפות נורווגיות ואנגלית על ידי הספרייה הלאומית של נורווגיה. המודל שוקל מעל מיליארד וחצי פרמטרים ומיועד לתמלול ותרגום שדורשים דיוק מקסימלי.

  • 1.5Bפרמטרים
  • 39.1 GBמשקל הקבצים
  • 13,480הורדות בחודש
  • 43לייקים

מה זה

מדובר במודל ASR ותרגום המבוסס על Whisper Large v3 של OpenAI, שעבר אימון ייעודי של 250,000 צעדים על 66,000 שעות של קטעי שמע נורווגיים. הדאטה כולל הקלטות מהפרלמנט הנורווגי, שידורי טלוויזיה וספרי שמע. המודל מסוגל לתמלל ולתרגם בין נורווגית, נינורסק ואנגלית, ומכוון לייצר משפטים כתובים ותקינים תחבירית במקום פלט פונטי עיוור.

בניגוד לגרסת הבסיס הכללית של Whisper, ההתמקדות כאן היא בכיסוי עמוק של הדיאלקטים הנורווגיים. היוצרים שחררו במקביל גם גרסת verbatim נפרדת שעברה עוד 250 צעדי אימון ומחזירה תמלול אותיות קטנות מילולי מאוד, עבור מי שצריך ניתוח בלשני מדויק ולא עריכה סמנטית נקייה.

מתאים ל

  • תמלול ארכיונים בנורווגית

    הוא אומן על עשרות אלפי שעות מוסדיות בנורווגית ומספק איכות גבוהה מאוד לדיבור מקומי.

  • הפרדת דוברים מורכבת

    התאמה מובנית לכלים כמו WhisperX מאפשרת הפקת חותמות זמן מדויקות ברמת המילה לשיחות מרובות משתתפים.

  • תרגום מנורווגית לאנגלית

    הארכיטקטורה מאפשרת להזין קובצי שמע בדיאלקטים נורווגיים שונים ולקבל תרגום ישיר לאנגלית תקנית.

איפה זה נופל

היוצרים מזהירים שהמודל נוטה להזיות ולחזרות פנימיות, במיוחד אם מזינים קבצים שאורכם עולה על 30 שניות בלי לחלק אותם למקטעים. לפי התיעוד, חיתוך למקטעים של 28 שניות עובד טוב יותר מברירת המחדל, אך עדיין דורש הגדרה ידנית כדי למנוע לולאות טקסט.

בנוסף, הנטייה לייצר שפה תקנית גורמת לפעמים להשמטת מילים או לשינוי הניסוח המקורי של הדובר. ישראלים שמחפשים מודל לתמלול שפות מקומיות צריכים לשים לב שאין כאן שום תמיכה בעברית, והאימון כולו מוגבל לשפות נורווגיות ואנגלית בלבד.

שאלות
נפוצות

האם המודל תומך בתמלול הקלטות בעברית?

לא. המודל אומן ונבדק אך ורק על נורווגית, נינורסק ואנגלית. הוא לא מיועד לעברית ולא יפיק תוצאות רלוונטיות לקובצי קול בשפות אחרות.

איך אפשר למנוע ממנו לחזור על אותו משפט בלולאה?

התיעוד מציע להגדיר את אורך המקטעים ל־28 שניות בדיוק באמצעות הפרמטר chunk_length_s בספריית transformers. קבצים ארוכים ללא הגדרה זו גורמים למודל לייצר חזרות מרובות על מילים בסוף הקטע.

מה ההבדל בין הגרסה הזו לגרסת ה־Verbatim?

גרסת הבסיס מתקנת את המשפטים לצורה תחבירית מסודרת ונקייה. גרסת ה־verbatim עברה כיוונון קצר נוסף כדי לתמלל את המילים המדויקות שנאמרו בלי עריכה, והיא פולטת טקסט באותיות קטנות בלבד.

איך מריצים

המודל כולל כמעט 1.55 מיליארד פרמטרים, ובניגוד לגרסאות הקטנות בסדרה שמסוגלות לרוץ על מעבד, כאן צריך כרטיס מסך עם זיכרון ייעודי כדי לעבוד בקצב סביר. הקבצים המקוריים תופסים נפח עצום בגלל שמירת המשקלים, אבל המפתחים מספקים המרות לפורמטים כמו ggml וגרסת קוונטיזציה של q5_0 שמאפשרת להריץ אותו מקומית וביעילות דרך whisper.cpp.

אם אין לכם חומרה גרפית חזקה וזמינה, עבודה עצמאית מול משקלים בגודל כזה תהיה אטית ומסורבלת, ובמקרים כאלה עדיף לפנות לפתרונות ענן מנוהלים. מי שבוחר להריץ בעצמו דרך ספריית transformers יקבל תוצאות מדויקות יותר בהגדרת beam size של 5, שדורשת מעט יותר זיכרון.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="NbAiLab/nb-whisper-large")
print(pipe("שלום"))

הקבצים

72 קבצים במאגר, 39.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים מופצים תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי מלא, שינוי הקוד והפצה פנימית או חיצונית במוצרים סגורים. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים המקוריות. יוצרי המודל מבקשים לייחס את התמלולים למערכת כדי למנוע לכלוך של דאטהסטים עתידיים, ומציינים שבנורווגיה חלים חוקי זכויות יוצרים מקומיים לגבי ייחוס.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗