GPT
M

mms-300m-1130-forced-aligner

קוד פתוח

MahmoudAshrafcc-by-nc-4.02024-05-02

  • transformers
  • pytorch
  • safetensors
  • wav2vec2
  • automatic-speech-recognition

המודל הזה מצמיד טקסט לאודיו קיים ומייצר חותמות זמן מדויקות. הוא מבוסס על MMS של מטא בגרסה מותאמת לספריית transformers שצורכת פחות זיכרון מעבודה ישירה מול torchaudio.

  • 315Mפרמטרים
  • 2.4 GBמשקל הקבצים
  • 2,673,637הורדות בחודש
  • 103לייקים

מה זה

מדובר בהמרה של משקולות MMS מבית מטא לתצורת Hugging Face, כשהייעוד המרכזי כאן אינו תמלול מאפס אלא forced alignment. אתם מספקים קובץ שמע ואת הטקסט המדויק שנאמר בו, והוא מתאים ביניהם ברמת המילה או הפונמה. הוא רץ על ארכיטקטורת Wav2Vec2 עם מנגנון CTC ובנוי מ־24 שכבות שמכסות 315 מיליון פרמטרים.

היתרון במימוש שהועלה כאן הוא שילוב של הקוד הייעודי שפרסם היוצר, אשר חוסך שימוש בזיכרון ביחס למנגנון הקיים ב־torchaudio. במקום להיאבק בהמרות ידניות וניהול זיכרון כבד, אפשר להשתמש בתשתית הרגילה של transformers ולייצר כתוביות מסונכרנות במאות שפות שונות, כולל ערבית ושפות אזוריות אחרות.

מתאים ל

  • סנכרון כתוביות לקובצי וידאו

    לקיחת תסריט קיים והצמדתו לדיבוב או להרצאה כדי לקבל נקודות זמן מדויקות לחיתוך שקופיות.

  • אימון נתונים למודלי דיבור

    חיתוך מאגרי הקלטות ארוכים למקטעים קצרים לפי משפטים עבור אימון של מודלי TTS.

  • ניתוח פונטי במחקר בלשני

    התאמת הגייה של מילים ספציפיות באודיו מרובה שפות לצורך בדיקת משכי זמנים והברות.

איפה זה נופל

אם אין לכם תמלול מוכן מראש, אין לכם מה לעשות איתו. הוא לא מודל שנועד לשמוע שיחה ולנחש מה נאמר בה. בנוסף, רשימת השפות המדווחת כוללת שפות ספציפיות כמו ערבית, אפריקאנס ואמהרית, אך עברית אינה מופיעה ברשימה הזו. אם תנסו ליישר איתו שמע בעברית, קרוב לוודאי שתקבלו תוצאות שגויות. צריך גם לקחת בחשבון שהמשקולות מגיעות ב־float32, ולכן תצטרכו להמיר אותן לבד אם תרצו לחסוך עוד זיכרון.

שאלות
נפוצות

אפשר להשתמש בו כדי לתמלל פודקאסט שאין לו טקסט?

לא. המודל מיועד לביצוע forced alignment בלבד, כלומר הוא מקבל את האודיו יחד עם הטקסט הקיים ורק מוצא מתי כל מילה נאמרה. בשביל תמלול מלא של שיחה לא מוכרת תצטרכו מודל זיהוי דיבור רגיל.

האם הוא תומך בהרצה על גבי מעבד רגיל בלי GPU?

כן. עם 315 מיליון פרמטרים וגודל של 2.4 גיגה־בייט, מעבד מודרני ממוצע יכול להריץ אותו בקצב סביר מאוד עבור קבצים באורך סטנדרטי.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.4 גיגה־בייט בפורמט float32, כך שתוכלו להריץ אותו בקלות על מעבד רגיל או על כרטיס מסך בסיסי בלי שום ציוד מיוחד. כל מחשב פיתוח מודרני עם כרטיס של 4 עד 6 גיגה זיכרון יריץ אותו מהר ובלי לחנוק את המערכת.

ההתקנה דורשת התקנת חבילת פייתון ישירות מהמאגר של המפתח בגיטהאב. בגלל הגודל הקומפקטי שלו והיעדר הצורך בחומרה יקרה, אין שום סיבה לשלם ל־API חיצוני על פעולה של התאמת תמליל קיים.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="MahmoudAshraf/mms-300m-1130-forced-aligner")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה: אסור להשתמש במודל הזה בשום מוצר מסחרי, שירות בתשלום או פעילות עסקית שמניבה רווח. השימוש מותר למחקר, לפרויקטים אישיים ולניסויים בלבד, וכל הפצה מחדש דורשת מתן קרדיט מלא למחברים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗