GPT
W

whisper-hindi-large-v2

קוד פתוח

vasista22apache-2.02023-01-14

  • transformers
  • pytorch
  • jax
  • whisper
  • automatic-speech-recognition

התאמה ייעודית של מודל התמלול הגדול לדיבור בהינדי. הוא פונה למי שצריך לתמלל הקלטות בהינדי ומחפש דיוק משופר ממאגרי מידע מקומיים.

  • 11.5 GBמשקל הקבצים
  • 1,269הורדות בחודש
  • 51לייקים
  • 32שכבות

מה זה

מדובר בגרסת Large-v2 של וויספר שעברה אימון נוסף ספציפית על הינדי, במסגרת מרתון כוונון מודלים ובתמיכת מעבדת הדיבור של IIT Madras. הבסיס המקורי אמנם תומך בשפות רבות, אך כוונון ממוקד על שפה בודדת נועד לצמצם שגיאות תמלול הנובעות ממבטאים מקומיים וממילים ייחודיות.

האימון התבסס על ארבעה מאגרים שונים של דיבור בהינדי, ביניהם GramVaani, ULCA, Shrutilipi והחלק ההינדי של Fleurs. השילוב הזה חושף את המודל למגוון מקורות אקוסטיים, מדיבור יומיומי ועד הקלטות רשמיות יותר. הוא מכיל 32 שכבות בארכיטקטורת המקור, ללא שינוי במבנה הבסיסי.

היוצרים לא פירסמו מדדי שגיאה מספריים כמו אחוזי שגיאת מילים בעמוד המודל, למרות שציינו סטים ספציפיים לבדיקה. בלי המספרים האלה, קשה לדעת בדיוק כמה הוא מדויק יותר מגרסת המקור של OpenAI, ותצטרכו למדוד אותו על המידע שלכם.

מתאים ל

  • תמלול שיחות בהינדי

    המודל עבר אימון על מאגרים רחבים ומסוגל להמיר הקלטות שמע ארוכות לטקסט הינדי כתוב.

  • עיבוד אצווה מהיר

    קוד האינפרנס כולל תמיכה מובנית ב־whisper-jax לעיבוד קבצי אודיו רבים במקביל על חומרה חזקה.

  • מחקר אקדמי על דיבור

    הקוד לאימון זמין במלואו בריפו מקושר, דבר שמאפשר לבדוק את שיטות הכוונון על מאגרי שמע נוספים.

איפה זה נופל

החיסרון המרכזי כאן הוא חוסר מוחלט במדדי הערכה כמותיים בעמוד המודל. לא פורסם ציון WER על אף אחד ממאגרי הבדיקה, כך שאין דרך לדעת מה רמת הדיוק שלו לפני שמריצים בפועל. בנוסף, האימון הופסק אחרי 57,000 צעדים מתוך תכנון מקורי של 116,255 צעדים, ללא הסבר מדוע הוא נחתך באמצע.

המודל מוגבל לשפה אחת בלבד. הקוד מקבע את הפענוח להינדי, כך שהוא אינו מיועד לתמלול מעורב של הינדי ואנגלית או לשפות אחרות בלי בדיקה נפרדת.

שאלות
נפוצות

האם המודל תומך בשפות נוספות חוץ מהינדי?

המודל מבוסס על וויספר הרב לשוני, אך הכוונון הנוכחי והגדרות הפענוח המוצעות מכוונים ספציפית להינדי. אם תנסו לתמלל שפות אחרות, סביר להניח שהתוצאות יהיו פחות טובות מגרסת הבסיס הרגילה.

האם אפשר להריץ אותו על מחשב רגיל בלי כרטיס מסך ייעודי?

הקוד תומך בהרצה על מעבד רגיל, אך הקבצים שוקלים 11.5 גיגה בייט והתהליך יהיה אטי מאוד. בשביל מהירות עבודה סבירה בגרסת Large מומלץ להשתמש במאיץ גרפי מתאים.

איך מריצים

טעינת המודל מתבצעת דרך ספריית transformers הרגילה בפייתון, עם ציון מפורש של קוד השפה להינדי. היוצרים מספקים גם דוגמה להרצה דרך whisper-jax, המאפשרת עיבוד מקבילי בקבוצות גדולות למי שרוצה לסחוט ביצועים טובים יותר.

המשקל הכולל של הקבצים מגיע ל־11.5 גיגה בייט בדיוק float32. כדי להריץ אותו מקומית בלי לקבל שגיאות זיכרון תצטרכו כרטיס מסך עם לפחות 16 גיגה בייט של VRAM. אם אתם מעבדים רק קבצים בודדים מדי פעם, שימוש בשרת ייעודי או שירות מנוהל חיצוני יהיה פשוט וזול בהרבה מלהחזיק חומרה כזו דולקת.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="vasista22/whisper-hindi-large-v2")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והפצה מחדש בלי תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בכל תוצר שמבוסס עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗