GPT
M

mms-1b-all

קוד פתוח

facebookcc-by-nc-4.02023-05-27

  • transformers
  • pytorch
  • safetensors
  • wav2vec2
  • automatic-speech-recognition

תמלול קול שמכסה 1162 שפות שונות תחת ארכיטקטורה אחת. פתרון ממוקד למי שצריך תמיכה במגוון עצום של שפות ודיאלקטים נדירים.

  • 965Mפרמטרים
  • 8.3 GBמשקל הקבצים
  • 289,502הורדות בחודש
  • 205לייקים

מה זה

בסיס התשתית בנוי על Wav2Vec2 בגודל של 964,845,850 פרמטרים, אשר עבר אימון נוסף כדי לתמלל קול ישירות לטקסט. במקום להחזיק מודל נפרד לכל שפה או מודל ענק שלא נכנס לשום זיכרון, הוא משתמש במתאמים. הבסיס נשאר קבוע בזיכרון, ואתם טוענים מתאם קטן לפי קוד השפה המבוקשת, מתוך 1162 שפות נתמכות. הרשימה כוללת שפות נפוצות וגם עברית תחת הקוד heb.

ההבדל המשמעותי לעומת מודלים אחרים בקטגוריית המיליארד פרמטרים הוא רוחב היריעה. אין כאן מודל שמנסה לנחש הכל בבת אחת ופולט טעויות בין שפות דומות, אלא מנגנון שבו בוחרים במפורש את שפת היעד. הטוקנייזר והמתאם מתחלפים בהוראה אחת בקוד, מה שמאפשר לעבד קובצי אודיו משפות שונות באותו תהליך עבודה.

מתאים ל

  • תמלול ארכיונים רב לשוניים

    כיסוי של 1162 שפות מאפשר תמלול מסמכי שמע באותו כלי עבודה.

  • מחקר אקדמי של שפות נדירות

    גישה פתוחה למתאמי שמע עבור דיאלקטים שאין להם כלי מדף אחרים.

  • פרויקטי קוד פתוח ללא מטרות רווח

    שימוש בתשתית תמלול רחבה ללא עלויות רישוי תחת מגבלות השימוש הלא מסחרי.

איפה זה נופל

הכרטיס לא מציג תוצאות מדידה או אחוזי שגיאות מילים, כך שאי אפשר לדעת מראש מה רמת הדיוק בכל שפה בלי לבדוק בפועל על הנתונים שלכם. החלפת שפה דורשת טעינה מפורשת של מתאם והגדרת שפת היעד בטוקנייזר, כך שהוא לא מזהה שפות באופן אוטומטי מתוך האודיו. אם אתם מקבלים הקלטה ולא יודעים מה השפה שמדוברת בה, תצטרכו מנגנון זיהוי נפרד לחלוטין לפני שליחת הקובץ לתמלול.

שאלות
נפוצות

האם אפשר להריץ אותו במסחר או במוצר בתשלום?

לא. הרישיון המוגדר הוא cc-by-nc-4.0 שמונע במפורש כל שימוש מסחרי. כדי לבנות מוצר מסחרי תצטרכו לחפש חלופה אחרת עם רישיון שמתיר זאת.

האם המודל מזהה לבד באיזו שפה מדברים בהקלטה?

לא. התהליך מחייב להגדיר את שפת היעד בטוקנייזר ולטעון את המתאם המתאים לה לפני התמלול. המודל מתמלל את השפה שהוגדרה לו מראש ולא מבצע זיהוי שפה אוטומטי.

האם יש צורך להוריד את כל 999 הקבצים מראש?

המודל מחזיק את משקלי הבסיס ומתאמים נפרדים לכל שפה. בזמן העבודה דרך transformers המערכת פונה למתאם הרלוונטי לפי קוד השפה שביקשתם.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־8.3 GB והם מפוזרים בין 999 קבצים נפרדים בגלל ריבוי המתאמים. כדי להריץ אותו דרך ספריית transformers תצטרכו גרסה 4.30 לפחות, יחד עם חבילות כמו torch, datasets ו־accelerate. האודיו הנכנס חייב להיות בדיגום של 16000 הרץ, אחרת התוצאות פשוט לא יהיו נכונות.

מבחינת חומרה, קריטי לקחת בחשבון את נפח המודל וסביבת העבודה בזמן עיבוד האודיו. לא הייתי מנסה לתמלל איתו כמויות אודיו בזמן אמת בלי מעבד גרפי ייעודי עם מספיק זיכרון להחזקת משקלי הבסיס והחישובים.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="facebook/mms-1b-all")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה וישירה: אסור להשתמש במודל הזה בשום צורה מסחרית. הוא מיועד למחקר, בדיקות או פרויקטים פנימיים לא מסחריים בלבד, וכל ניסיון לשלב אותו במוצר שמייצר הכנסה מפר את תנאי הרישיון.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗