GPT
S

seamless-m4t-v2-large

קוד פתוח

facebookcc-by-nc-4.02023-11-29

  • transformers
  • safetensors
  • seamless_m4t_v2
  • feature-extraction
  • audio-to-audio

מערכת תרגום ותמלול רב לשונית מקצה לקצה שמחברת ישירות בין שמע לטקסט ולדיבור. שווה לבדוק אותה כשרוצים לדלג על שרשור של מספר מודלים שונים.

  • 2.3Bפרמטרים
  • 4,096טוקנים בהקשר
  • 27.8 GBמשקל הקבצים
  • 301,923הורדות בחודש

מה זה

מטא בנתה כאן מודל רב תכליתי של 2.3 מיליארד פרמטרים שמבצע תמלול, תרגום טקסט, ותרגום משמע ישירות לשמע אחר או לטקסט. המערכת תומכת בקלט קולי מתוך 101 שפות, קלט ופלט כתובים ב־96 שפות, ויצירת דיבור ב־35 שפות. המעבר המרכזי מגרסה אחת לשתיים הוא מעבר לארכיטקטורת UnitY2, שמשתמשת בפענוח מקבילי של טקסט ליחידות שמע, מה שמקצר את זמני הריצה ביצירת דיבור בהשוואה לגרסה הקודמת.

במקום לחבר מודל זיהוי דיבור, מודל תרגום טקסט ומנוע הקראה נפרד, מקבלים צינור אחד שעושה את כל המסלול. היתרון הוא פחות תחזוקה של רכיבים נפרדים, אבל החיסרון הוא שגיאות שמצטברות לאורך העיבוד בלי יכולת לתקן באמצע.

מתאים ל

  • תמלול ותרגום מהיר של הקלטות

    הוא קולט שמע ב־101 שפות ופולט טקסט ישירות בשפה אחרת בריצה אחת, כולל עברית.

  • תרגום קולי לשפות נבחרות

    מערכת דיבוב שממירה קול משפה אחת ישירות לשמע ב־35 שפות נתמכות ללא שלבי ביניים.

  • מחקר ופיתוח מודלי שמע

    התשתית מתאימה לניסויי התאמה אישית בעזרת סקריפטים מוכנים שפורסמו עבור ארכיטקטורת UnitY2.

איפה זה נופל

ההבדל בין השפות נחתך בצורה חדה כשמגיעים לפלט קולי, שזמין רק עבור 35 שפות לעומת 101 בקלט. עברית נתמכת לקלט דיבור, קלט טקסט ופלט טקסט, אבל המודל לא מייצר עבורה קובצי שמע כלל. בנוסף, חלון ההקשר מוגבל ל־4,096 טוקנים, ולכן הוא לא מתאים לעיבוד רצוף של קבצי שמע ארוכים או שיחות מתמשכות ללא חיתוך ידני מקדים.

שאלות
נפוצות

האם המודל יודע להקריא טקסט בעברית?

לא. עברית נתמכת כקלט קולי וכקלט או פלט של טקסט בלבד. יצירת דיבור מוגבלת ל־35 שפות אחרות, כך שלצורך הפקת שמע בעברית תצטרכו לחבר מנוע הקראה חיצוני.

האם כדאי להריץ אותו רק בשביל תמלול עברית?

לא מומלץ. בשביל לתמלל בלבד אתם מורידים קבצים במשקל 27.8 גיגה בייט ודורשים חומרה כבדה ויקרה, כשיש מודלים ייעודיים לזיהוי דיבור שדורשים שבריר מהמשאבים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־27.8 גיגה בייט בדיוק מלא של float32, כך שצריך כרטיס מסך עם לפחות 32 גיגה בייט של זיכרון כדי לטעון אותו ישירות מהקופסה בלי קוונטיזציה. קוד ההרצה מסתמך על transformers ועל sentencepiece, והשמע חייב לעבור דגימה מחדש ל־16 קילו הרץ לפני שמעבירים אותו לפרוססור.

גרסת Large הקודמת דרשה אותם משאבי חומרה אך הפיקה קול לאט יותר, בעוד גרסת ה־Medium מציעה 1.2 מיליארד פרמטרים ומתאימה למכונות קטנות יותר. אם המטרה היא תמלול פשוט או תרגום נקודתי בלי צורך בהפקת דיבור, עדיף להשתמש בפתרונות קלים וממוקדים יותר במקום לסחוב כרטיס גרפי יקר.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="facebook/seamless-m4t-v2-large")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0, שמשמעותו איסור מוחלט על שימוש מסחרי. מותר לחקור, ללמוד ולהריץ ניסויים פנימיים, אך אסור להטמיע את המודל בתוך מוצר שנמכר, מוצע כשירות בתשלום או מייצר הכנסה עסקית.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗