GPT
M

mms-300m

קוד פתוח

facebookcc-by-nc-4.02023-05-22

  • transformers
  • pytorch
  • wav2vec2
  • pretraining
  • mms

מודל בסיס רב לשוני לעיבוד אודיו שאומן על כחצי מיליון שעות הקלטה ביותר מ־1,400 שפות. הוא מיועד למי שרוצה לאמן בעצמו מודל שמע קל יחסית למשימה ספציפית.

  • 1.2 GBמשקל הקבצים
  • 12,171הורדות בחודש
  • 368לייקים
  • 24שכבות

מה זה

מדובר במודל בסיס לשמע שפותח על בסיס ארכיטקטורת Wav2Vec2 עם עשרים וארבע שכבות. המאמנים שלו לקחו כחצי מיליון שעות של דיבור גולמי והריצו עליהן אימון בשיטת לימוד עצמי, כך שהרשת למדה את המבנה האקוסטי והפונטי של מגוון עצום של דיאלקטים ולשונות.

ההבדל המרכזי בינו לבין מודלים רגילים שנפוצים ברשת הוא היקף השפות והעובדה שהוא שוקל רק 1.2 גיגה בייט. רוב המודלים מגיעים מכוונים לשפה אחת או שתיים, או שהם שוקלים מיליארדי פרמטרים. כאן מקבלים בסיס קומפקטי שמכיר המון שפות נידחות ומוכן להרחבה, בלי להעמיס משקלים מפלצתיים על השרת שלכם.

מתאים ל

  • אימון זיהוי דיבור מותאם

    בסיס מצוין ללימוד מודל תמלול עצמאי, במיוחד אם אתם עובדים עם שפות שאין להן דאטהסטים ענקיים מוכנים מראש.

  • סיווג אודיו וזיהוי שפות

    הוא למד ייצוגים של מעל 1,400 שפות, כך שאפשר לאמן עליו מסווג שפות או מזהה דוברים ביעילות רבה.

  • מחקר אקדמי בתחום השמע

    מודל נוח וקל יחסית לניסויים על ייצוגי קול גולמיים בלי להזדקק למשאבי מחשוב כבדים מדי.

איפה זה נופל

זה לא מודל שמוכן לשימוש ישיר מהקופסה. אם תזרקו לתוכו קובץ קול, הוא לא יחזיר לכם תמלול או תרגום, כי מדובר במודל בסיס שחייב לעבור פיין טיונינג למשימה מוגדרת כמו זיהוי דיבור, סיווג אודיו או תרגום.

בנוסף, כל הקלט חייב לעבור המרה מקדימה לקצב של 16 קילו הרץ. אם תזינו קבצים באיכות שונה בלי עיבוד מוקדם, המודל פשוט יזייף. מי שמחפש פתרון מהיר של הורדה והרצה בלי לכתוב קוד אימון ובלי להכין דאטהסט מתויג מראש, יבזבז כאן את הזמן.

אותה משפחה

mms יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר פשוט להעלות קובץ ולקבל טקסט?

לא. המודל הזה הוא שלד שעבר אימון ראשוני בלבד, והוא לא יודע לפלוט תווים או מילים בלי שעבר אימון ייעודי לתמלול.

איזה כרטיס מסך צריך בשביל להריץ אותו?

המשקל שלו הוא 1.2 גיגה בייט בלבד, כך שכל כרטיס מסך מודרני עם כמה גיגות בודדות של זיכרון יספיק כדי להעלות אותו ולהריץ עליו אימון.

מותר לי למכור שירות שמבוסס עליו?

לא, הרישיון אוסר על כל פעילות מסחרית. הוא מתאים למחקר, בדיקות פנימיות וקוד פתוח בלבד.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בפייתון, והמשקל הכולל יושב על קצת יותר מגיגה בייט אחד בקבצים. בגלל הגודל הזה, לא צריך חוות שרתים כדי להחזיק אותו בזיכרון, וכרטיס מסך בסיסי עם 4 עד 8 גיגה בייט של זיכרון יריץ אותו בקלות.

השמע חייב להיכנס בקצב דגימה של 16 קילו הרץ בדיוק, אחרת התוצאות ייפגעו לחלוטין. אם אתם רק צריכים תמלול מוכן ולא רוצים לכוונן שום דבר בעצמכם, עדיף לחפש גרסה שכבר עברה אימון ייעודי או להשתמש בממשק מוכן, כי המודל הזה דורש עבודת אימון לפני שהוא פולט טקסט.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/mms-300m")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC-BY-NC 4.0, מה שאומר שמותר להשתמש בו ולשנות אותו רק למטרות מחקר או פרויקטים ללא כוונת רווח. שימוש מסחרי מכל סוג, כולל שילוב במוצר של חברה או מכירת שירותים שמבוססים עליו, אסור לגמרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗