GPT
K

kotoba-whisper-v2.2

קוד פתוח

kotoba-techapache-2.02024-10-18

  • transformers
  • safetensors
  • whisper
  • automatic-speech-recognition
  • audio

מודל תמלול ייעודי ליפנית שמשלב זיהוי דוברים ופיסוק מובנה ישירות בצינור העבודה. אם אתם מעבדים שיחות או הקלטות ביפנית, הוא פותר לכם את כל עבודת ההרכבה מסביב.

  • 756Mפרמטרים
  • 2.8 GBמשקל הקבצים
  • 15,886הורדות בחודש
  • 130לייקים

מה זה

מדובר במודל זיהוי דיבור של 756 מיליון פרמטרים שמבוסס על Whisper ומיועד בלעדית לשפה היפנית. הבסיס שלו נשען על גרסה קודמת של החברה, אבל החידוש בגרסה הזו הוא שילוב של שכבות עיבוד נוספות ישירות בתוך צינור העבודה של transformers. במקום רק להוציא טקסט גולמי, הוא כולל מודל לחלוקת דוברים ומודל שמוסיף סימני פיסוק.

השילוב הזה אומר שאתם מקבלים פלט שמחולק לפי דובר עם טקסט קריא ומפוסק בלי שתצטרכו לתזמר בעצמכם ספריות חיצוניות נפרדות. הוא נבנה בעזרת קוד של Distil-Whisper ומשתמש במאגר ReazonSpeech, מה שמסביר את ההתמקדות החדה בשוק היפני ובצרכים הספציפיים של השפה הזו.

מתאים ל

  • תמלול ישיבות ביפנית

    זיהוי הדוברים המובנה והפיסוק מאפשרים להפריד בין משתתפי השיחה בלי לכתוב שכבת עיבוד נוספת.

  • ניתוח מוקדי שירות

    המערכת מפרידה בין נציג ללקוח לפי דוברים מוגדרים מראש על גבי שיחות מוקלטות ביפנית.

  • הפקת כתוביות לראיונות

    הוספת סימני הפיסוק האוטומטית הופכת את הטקסט היפני לקריא ומוכן לחלוקה למשפטים.

איפה זה נופל

המודל תומך ביפנית בלבד. אם יש לכם הקלטה מעורבת עם אנגלית או עברית, הוא פשוט לא מיועד לזה ולא ייתן תוצאות סבירות. מעבר לזה, רכיב זיהוי הדוברים נשען על מודלים חיצוניים שמחייבים הרשמה ואישור פרטני, כך שההתקנה לא מסתכמת רק בהורדת משקלים מהמאגר.

היוצרים גם מציינים במפורש שלפעמים נדרשת הוספה ידנית של חצי שנייה של שקט בתחילת האודיו ובסופו כדי לשפר את איכות התמלול. בעיה כזו מעידה על רגישות לקצוות הקלט, מה שמחייב אתכם לבצע בדיקות מקדימות על האודיו שלכם לפני שאתם שולחים אותו לעיבוד רציף.

אותה משפחה

kotoba-whisper יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לתמלל הקלטות בעברית או באנגלית?

לא. המודל אומן והותאם אך ורק עבור השפה היפנית. להקלטות בשפות אחרות תצטרכו להשתמש במודל Whisper כללי.

האם אפשר להריץ אותו בלי רכיב זיהוי הדוברים?

כן. זיהוי הדוברים והפיסוק הם שלבים אופציונליים בתוך צינור העבודה. אם אתם צריכים רק תמלול נקי, אפשר לוותר עליהם ולחסוך את הצורך באישורי הגישה למודלים של pyannote.

איך מריצים

המודל שוקל 2.8 גיגה בייט ומבוסס על ארכיטקטורת float32 עם 32 שכבות, כך שהוא רץ בקלות על כרטיס מסך ביתי מודרני עם תמיכה ב־Flash Attention 2 כדי לקצר זמנים. ההרצה נעשית ישירות דרך ספריית transformers מגרסה 4.39 ומעלה, לצד תלויות כמו pyannote.audio, punctuators ו־diarizers.

שימו לב שבשביל מנגנון זיהוי הדוברים תצטרכו להתחבר עם טוקן של Hugging Face ולאשר תנאי שימוש לשני מודלים חיצוניים של pyannote. אם מדובר בקובץ בודד פעם בחודש, סביר שעדיף לכם שירות ענן מוכן, אבל אם יש לכם זרימת שיחות קבועה ביפנית, ההרצה העצמאית כאן זולה ומאפשרת לקבוע מראש את טווח כמות הדוברים.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="kotoba-tech/kotoba-whisper-v2.2")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה חופשית בלי לשלם תמלוגים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי. שימו לב שהמודלים הנוספים של pyannote שמשמשים לחלוקת דוברים דורשים אישור תנאים נפרד משלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗