GPT
W

w2v-bert-2.0

קוד פתוח

facebookmit2023-12-19

  • transformers
  • safetensors
  • wav2vec2-bert
  • feature-extraction
  • af

מקודד אודיו שמיועד לשמש בסיס למשימות עיבוד דיבור מתקדמות. הוא אומן על מיליוני שעות הקלטה רב-לשוניות, ומתאים למי שרוצה לבנות מודל זיהוי קולי משלו.

  • 580Mפרמטרים
  • 4.3 GBמשקל הקבצים
  • 2,271,473הורדות בחודש
  • 230לייקים

מה זה

מדובר במקודד דיבור שמבוסס על ארכיטקטורת Conformer וכולל 24 שכבות עם כ־580 מיליון פרמטרים. פייסבוק אימנו אותו על 4.5 מיליון שעות של אודיו לא מתויג ביותר מ־143 שפות שונות, והוא מהווה את רכיב הבסיס של מודלי Seamless שלהם. המודל עצמו לא מייצר טקסט ולא מתמלל שום דבר ישר מהקופסה, אלא מוציא וקטורים שמייצגים את האודיו.

בניגוד למודלי זיהוי דיבור מוכנים, כאן מקבלים צ'קפוינט נקי לחלוטין של חילוץ מאפיינים בלי ראש חיזוי מעליו. הוא נועד למי שצריך ייצוג עמוק ומדויק של קול עבור שפות מגוונות, ורוצה לאמן עליו שכבה עליונה משלו לזיהוי דיבור או לסיווג קטעי שמע.

מתאים ל

  • אימון זיהוי דיבור

    משמש בסיס מצוין לכוונון עדין של מודלי תמלול בשפות שונות, הודות לאימון המקדים הרחב.

  • חילוץ וקטורים מאודיו

    מייצר ייצוגים עמוקים של גלי קול לצורך השוואת שמע, חיפוש דמיון או משימות סיווג.

  • סיווג קטעי שמע

    הוספת שכבת סיווג פשוטה מעל המקודד כדי לזהות שפות, דוברים או מאפייני קול שונים.

איפה זה נופל

זה לא מוצר מוגמר וחשוב להבין את זה. המודל חסר ראש חיזוי, מה שאומר שהוא דורש כוונון עדין כדי לבצע משימות ספציפיות כמו זיהוי דיבור או סיווג שמע. אם תזינו לו הקלטה, לא תקבלו מילים אלא רק רצף מספרים. מי שמחפש פתרון שעובד מהשנייה הראשונה יתאכזב, כי נדרשת כאן עבודת אימון נפרדת.

שאלות
נפוצות

אפשר להשתמש בו ישירות כדי לקבל תמלול של קובץ קול?

לא. המודל מכיל רק את המקודד ללא שכבת חיזוי טקסט. כדי לקבל תמלול תצטרכו להוסיף שכבה מתאימה ולאמן אותה על נתוני דיבור עם כיתוב.

מה נדרש כדי להריץ את המודל באופן מקומי?

צריך סביבת פייתון עם ספריית transformers מותקנת ומעבד גרפי בסיסי עם לפחות 8 גיגה זיכרון. קבצי המודל תופסים 4.3 גיגה-בייט בדיוק המקורי שלו.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.3 גיגה-בייט בדיוק של float32, כך שכרטיס מסך פשוט עם 8 עד 12 גיגה זיכרון יספיק כדי להעלות אותו ולחלץ מאפיינים. מריצים אותו ישירות דרך ספריית transformers הרגילה של פייתון, באמצעות AutoProcessor ו־Wav2Vec2BertModel.

אם הכוונה היא רק להוציא וקטורים מקבצי קול, ההרצה המקומית פשוטה ומהירה. לעומת זאת, אם אתם צריכים תמלול מיידי ולא מתכננים לעשות אימון נוסף בעצמכם, עדיף להשתמש במודל מתומלל מוכן או בשירות קיים ולא לנסות להרים את זה לבד.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="facebook/w2v-bert-2.0")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 4.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון MIT. הרישיון הזה חופשי ומתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים המקורית בתוך התוכנה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗