GPT
W

wav2vec2-base

קוד פתוח

facebookapache-2.02022-03-02

  • transformers
  • pytorch
  • wav2vec2
  • pretraining
  • speech

בסיס קל משקל של 363 מגה-בייט ללמידת ייצוגי קול באנגלית. מיועד למי שרוצה לאמן מודל זיהוי דיבור מותאם אישית בלי להתחיל מאפס.

  • 363 MBמשקל הקבצים
  • 2,872,349הורדות בחודש
  • 125לייקים
  • 12שכבות

מה זה

מדובר במודל שפותח על ידי פייסבוק ומכיל 12 שכבות, שאומן על אודיו גולמי באנגלית בקצב דגימה של 16 קילו-הרץ. המודל לומד מבנה של דיבור מתוך קול בלבד בלי לראות טקסט, על ידי מיסוך באזור הנסתר של האות ופתרון משימה ניגודית. במבחנים על Librispeech עם כוונון על כל המידע המתויג, הוא מגיע לשגיאת מילים של 1.8 על דגימות נקיות ו־3.3 על דגימות מאתגרות.

הייחוד שלו הוא ביכולת להגיע לתוצאות טובות עם מעט מאוד מידע מתויג. אפילו עם עשר דקות בלבד של דיבור מתויג לאחר אימון מקדים על עשרות אלפי שעות קול, הגיעו במחקר לשגיאת מילים של 4.8 ו־8.2. זה הופך אותו לנקודת מוצא נוחה לפרויקטים שבהם אין לכם תקציב או זמן לתייג אלפי שעות הקלטה.

מתאים ל

  • בסיס לאימון תמלול באנגלית

    מאפשר לבנות מערכת זיהוי דיבור עם מעט שעות תיוג, בלי לאמן ארכיטקטורה קולית מאפס.

  • חילוץ מאפיינים מאודיו

    משמש לשליפת וקטורים של ייצוגי דיבור מתוך הקלטות קול גולמיות של 16 קילו-הרץ.

  • פרויקטים על חומרה חלשה

    המשקל הכולל של 363 מגה-בייט מאפשר לטעון אותו בקלות גם בסביבות פיתוח צנועות.

איפה זה נופל

הוא לא יודע להוציא טקסט מהקופסה. אין לו טוקנייזר ואין לו ראש לפענוח שפה, כי הוא אומן רק על קול ולא על תמלול. אם תזינו לו הקלטה בלי להוסיף טוקנייזר ולאמן אותו מראש על טקסט מתויג, תקבלו ייצוגים מתמטיים בלבד. בנוסף, הוא מצפה לקלט בדיוק בקצב של 16 קילו-הרץ ואומן על אנגלית, כך שהקלטות באיכות אחרת או בעברית ידרשו התאמה והמרה מראש.

שאלות
נפוצות

אפשר להשתמש בו ישירות כדי לקבל תמלול של קובץ אודיו?

לא. המודל אומן רק להבין ייצוגי קול ואין לו שכבת פלט של אותיות או טוקנייזר. בשביל לקבל טקסט צריך לאמן עליו שכבה נוספת עם מידע מתויג או להשתמש בגרסה שעברה fine-tuning מראש.

מה צריך לעשות עם קובץ הקול לפני שמעבירים אותו למודל?

הקובץ חייב להיות בקצב דגימה של 16 קילו-הרץ. אם תקליטו בקצב אחר תצטרכו להמיר את האודיו מראש, אחרת המודל יקבל נתונים שלא תואמים לאימון שלו.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בסביבת פייתון. הקבצים שוקלים בסך הכל 363 מגה-בייט, כך שלא צריך שרת מפלצתי או כרטיסי מסך יקרים כדי להחזיק אותו בזיכרון, ואפשר להריץ אותו בקלות גם על מעבד רגיל או GPU בסיסי ביותר.

אם אתם רוצים רק לתמלל קול ישירות לקובץ טקסט באפליקציה שלכם, אל תריצו את המשקלים האלה. עדיף לקחת מודל שכבר עבר fine-tuning לתמלול או לפנות ל־API מוכן, כי הגרסה הזו לבדה פשוט מחזירה וקטורים ולא מילים.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/wav2vec2-base")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 363 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המשקלים בתוך מוצר סגור או פתוח. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי, בלי אחריות משפטית מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗