GPT
M

mms-1b

קוד פתוח

facebookcc-by-nc-4.02023-05-22

  • transformers
  • pytorch
  • wav2vec2
  • pretraining
  • mms

מודל בסיס פתוח לעיבוד אודיו עם מיליארד פרמטרים, שאומן מראש על חצי מיליון שעות דיבור. הוא מיועד למי שרוצה לאמן מודל משלו על שפות נדירות או משימות שמע ייחודיות.

  • 3.6 GBמשקל הקבצים
  • 4,729הורדות בחודש
  • 57לייקים
  • 48שכבות

מה זה

מדובר בגרסת הבסיס של פרויקט שפת השמע של מטא, שנבנתה על ארכיטקטורת Wav2Vec2 עם 48 שכבות. המודל עבר אימון מקדים בלמידה עצמית על כחצי מיליון שעות אודיו ביותר מ־1,400 שפות שונות, נתון חריג בהיקפו בתחום עיבוד הקול.

המודל הזה לא נועד להוציא תמלול ישר מהקופסה. מטרתו היא לשמש תשתית חזקה שמבינה ייצוגי דיבור גולמיים, אותה מתאימים באמצעות כוונון עדין למשימות מוגדרות כמו זיהוי דיבור, סיווג קולי או תרגום שמע. מי שמחפש פתרון מוכן לעבודה יבחר בגרסאות שכבר עברו אימון ייעודי, אבל לחוקרים שמחפשים בסיס רחב במיוחד לשפות נידחות, זה המקום להתחיל בו.

מתאים ל

  • אימון זיהוי דיבור מותאם

    משמש כבסיס מושלם לאימון מודל תמלול עצמאי על שפות ספציפיות או דיאלקטים נדירים.

  • סיווג קטעי קול ושמע

    מחלץ ייצוגים עמוקים מאודיו גולמי כדי לאמן מודלים לזיהוי דובר או סיווג רגשות.

  • מחקר אקדמי בלמידת שמע

    אידיאלי לבדיקת שיטות אימון חדשות על מודל שראה מגוון עצום של 1,400 שפות.

איפה זה נופל

החיסרון המרכזי כאן הוא שמדובר במודל אימון מקדים ולא במודל תמלול עובד. אם תזרקו אליו קובץ שמע תקבלו וקטורים ולא טקסט, ולכן אי אפשר להשתמש בו למוצר בלי פיתוח וכוונון עדין מראש. בנוסף, חוסר הגמישות בקצב הדגימה מחייב אתכם לבצע המרה מוקדמת של כל שמע ל־16 קילו-הרץ. מי שבונה עליו צריך לקחת בחשבון את עלויות האימון הגבוהות.

אותה משפחה

mms יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להעלות קובץ ולקבל תמלול של השיחה?

לא. המודל הזה הוא גרסת בסיס שעברה אימון מקדים בלבד, והוא פולט ייצוגים מספריים ולא טקסט. כדי לקבל תמלול יש להשתמש בגרסאות המכווננות של הפרויקט או לאמן אותו בעצמכם על נתוני טקסט ואודיו תואמים.

האם אפשר להשתמש במודל הזה באפליקציה בתשלום?

ממש לא. הרישיון הוא רישיון לא מסחרי, מה שחוסם שימוש במוצרים מסחריים, בשירותים בתשלום או כחלק מפעילות עסקית שמניבה רווח.

איך מריצים

המשקל הכולל של הקבצים עומד על כ־3.6 גיגה-בייט ומריצים אותו באמצעות ספריית transformers של פייתון. כדי להריץ אימון המשך על מודל עם מיליארד פרמטרים בדיוק float32 תצטרכו כרטיס מסך עם זיכרון וידאו משמעותי, בדרך כלל מעל 16 או 24 גיגה-בייט, במיוחד אם אתם עובדים עם קטעי אודיו ארוכים.

קלט האודיו חייב להיות מדויק ולהגיע בקצב דגימה של 16 קילו-הרץ בלבד, אחרת המודל יחזיר פלט מעוות לחלוטין. אם אין לכם גישה לכרטיסי מסך חזקים ואתם רק צריכים תמלול שגרתי, עדיף להשתמש בגרסאות המכווננות של מטא או בשירותי ענן קיימים.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/mms-1b")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 3.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון cc-by-nc-4.0. המשמעות פשוטה: מותר להשתמש בו, לחקור אותו, לשנות אותו ולאמן אותו למטרות מחקר או פרויקטים אישיים, אבל אסור לחלוטין לעשות בו או בתוצרים שלו שימוש מסחרי מכל סוג.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗