GPT
M

mHuBERT-147

קוד פתוח

utter-projectcc-by-nc-sa-4.02024-03-14

  • transformers
  • pytorch
  • safetensors
  • hubert
  • feature-extraction

מודל אודיו קומפקטי שמחלץ ייצוגים ממאות שפות ומיועד למשימות דיבור במשאבים נמוכים. הוא מתאים למי שבונה זיהוי שפה או תמלול ולא רוצה לסחוב מפלצות ענק.

  • 94Mפרמטרים
  • 7.7 GBמשקל הקבצים
  • 87,296הורדות בחודש
  • 106לייקים

מה זה

הארכיטקטורה יושבת על בסיס של 94 מיליון פרמטרים עם 12 שכבות, בדיוק הגודל של מודל בסיס רגיל, אבל הוא אומן על 90 אלף שעות דיבור שמכסות 147 שפות. במקום ללכת בדרך הרגילה של HuBERT, הצוות השתמש ביחידות דיבור בדידות שנוצרו עם אינדקס faiss כדי לדחוס ולייצג את המידע בצורה יעילה יותר.

במדד ML-SUPERB הוא הגיע למקום הראשון בדירוג של שעה ולמקום השני בדירוג של עשר דקות, לצד תוצאות שיא בשלוש משימות של זיהוי שפת הדיבור. זה אומר שבגזרת המודלים הקטנים לחילוץ מאפייני אודיו, הוא נותן ייצוגים איכותיים מאוד בלי להזדקק למיליארדי פרמטרים.

מתאים ל

  • זיהוי שפת דיבור

    הוא קבע תוצאות שיא בשלוש משימות LID במדד ML-SUPERB, ומבדיל מצוין בין מגוון שפות עצום.

  • אימון מודל תמלול ייעודי

    משמש בסיס לחילוץ וקטורים עבור שפות עם מעט נתונים, לפני שמחברים ראש פענוח ספציפי.

  • המשך אימון קדם קולי

    המאגר כולל אינדקס faiss מוכן שמאפשר להמשיך את תהליך הלימוד על מאגרי אודיו חדשים.

איפה זה נופל

זה לא מודל שמחזיר טקסט ישירות, אלא כלי לחילוץ מאפיינים בלבד, ולכן אי אפשר לזרוק אליו קובץ קול ולקבל כתוביות בלי לאמן שכבה עליונה. חלק מהקבצים במערך האימון המקורי של CommonVoice הוסרו מאז בעקבות בקשות מחיקה, כך שאי אפשר לשחזר את האימון המדויק אחד לאחד. שפות שאינן חלק מהרשימה המאומנת יקבלו ייצוג ירוד.

שאלות
נפוצות

אפשר להשתמש בו ישירות כדי לקבל תמלול מקובץ הקלטה?

לא. מדובר במודל שמחלץ מאפיינים ומייצר וקטורים בלבד. כדי לקבל טקסט צריך לחבר אליו שכבת פלט מתאימה ולאמן אותה על נתוני תמלול.

אפשר לשלב אותו באפליקציה מסחרית של החברה?

לא, הרישיון כולל סעיף NC שאוסר כל שימוש מסחרי. הוא מיועד למחקר, בדיקות או פרויקטים פנימיים שאינם למטרות רווח.

איך מריצים

גודל המשקלים ברשת מגיע ל־7.7 גיגה בייט בגלל קובצי ה־faiss והמשקלים בפורמט המקורי, אבל המודל עצמו רץ דרך transformers בקלות. 94 מיליון פרמטרים נכנסים בלי בעיה לכל כרטיס מסך בסיסי עם ארבעה גיגה זיכרון, ואפשר אפילו להריץ דגימות על מעבד רגיל.

המאגר כולל גם את משקלי fairseq ואינדקס למי שרוצה להמשיך אימון, וגם משקלים מוכנים לשימוש ישיר. אם אתם צריכים רק תמלול מוכן מקצה לקצה, עדיף להשתמש במודל שלם או ב־API קיים, כי פה מקבלים רק וקטורים ומאפיינים שדורשים ראש אימון נוסף מעליהם.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="utter-project/mHuBERT-147")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-sa-4.0, מה שאומר שאסור להשתמש במודל הזה לצרכים מסחריים כלל. בנוסף, כל שינוי או פיתוח שמבוסס עליו חייב להיות מופץ תחת אותו רישיון בדיוק ועם מתן קרדיט ליוצרים. אם אתם בונים מוצר למכירה, המודל הזה פסול עבורכם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗