GPT
V

VibeVoice-ASR

קוד פתוח

microsoftmit2026-01-21

  • transformers
  • safetensors
  • vibevoice
  • ASR
  • Transcriptoin

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל תמלול שמקבל שעה שלמה של אודיו ברצף אחד ומוציא יחד טקסט, זיהוי דוברים וחותמות זמן. הוא מתאים למי שצריך תמלול פגישות ארוכות בלי לחתוך קבצים לחתיכות קטנות.

  • 8.7Bפרמטרים
  • 16.2 GBמשקל הקבצים
  • 706,931הורדות בחודש
  • 1,285לייקים

מה זה

מערכות תמלול רגילות חותכות אודיו למקטעים קצרים של כמה עשרות שניות, מה שהורס לעיתים קרובות את המעקב אחרי מי מדבר ומאבד הקשר כללי. כאן מקבלים קלט רציף של עד 60 דקות בחלון של 64K טוקנים בריצה בודדת. המודל פולט תמלול שמחבר יחד את תוכן הדיבור, זיהוי הדובר וחותמות זמן מדויקות, כך שלא צריך להריץ מודל נפרד לדיאריזציה.

הוא תומך ביותר מ־50 שפות ומזהה בעצמו מעברים בין שפות בתוך אותו משפט, בלי צורך להגדיר שפה מראש. יכולת מעניינת נוספת היא הזרקת מילות מפתח מותאמות אישית, שמאפשרת להזין שמות של אנשים, מונחים מקצועיים או הקשר ספציפי כדי לשפר זיהוי של מושגים נדירים.

מתאים ל

  • תמלול פגישות מרובות משתתפים

    הוא מזהה דוברים ומתמלל שעה שלמה ברצף, כך שהוא חוסך חיבור של כמה כלים נפרדים לפגישה אחת.

  • תמלול פודקאסטים ושיחות טכניות

    אפשר להזין מראש מונחים מקצועיים ושמות כדי שהמודל לא ימציא מילים כשיש ז'רגון מקצועי.

  • שיחות שמשלבות כמה שפות

    הוא יודע לזהות מעבר בין שפות באמצע הדיבור באופן אוטומטי בלי שצריך להגדיר שפת יעד מראש.

איפה זה נופל

עברית לא מופיעה ברשימת השפות המרכזיות שנבדקו בכרטיס המודל, אלא רק שפות כמו אנגלית, סינית, ספרדית וצרפתית. מי שבונה עליו לתמלול בעברית חייב לבדוק אותו בעצמו לפני שהוא מתחייב ללקוחות. בנוסף, עיבוד של שעה שלמה בריצה אחת תופס המון זיכרון ועלול לדרוש משאבי חישוב כבדים מאוד אם הקלט מתקרב למגבלת ה־64K טוקנים.

אותה משפחה

VibeVoice-ASR יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

עברית לא צוינה ברשימת השפות המרכזיות בעמוד המודל. אף על פי שהוא מצהיר על תמיכה ביותר מ־50 שפות, כדאי להריץ בדיקה על כמה קבצי דגימה לפני שבונים עליו למוצר ישראלי.

איזה כרטיס מסך נדרש כדי להריץ שעה שלמה של אודיו?

המודל שוקל 16.2 גיגה-בייט ומכיל 8.7 מיליארד פרמטרים, לכן תצטרכו כרטיס עם 24 גיגה-בייט זיכרון גרפי לפחות. כדי למצות את מלוא חלון ההקשר של 60 דקות בלי לקבל שגיאות זיכרון, עדיף להשתמש בכרטיסים מקצועיים עם זיכרון גדול יותר או להריץ דרך vLLM.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־16.2 גיגה-בייט עם כ־8.7 מיליארד פרמטרים, מה שאומר שצריך כרטיס מסך חזק עם לפחות 24 גיגה-בייט זיכרון וידאו להרצה סבירה, רצוי מסדרות מקצועיות אם רוצים לנצל את מלוא חלון ההקשר הארוך.

הוא נתמך בספריית transformers וקיים תיעוד ייעודי להרצה מהירה דרך vLLM. אם אין לכם שרת ייעודי עם כרטיס מתאים או שאתם מתמללים רק קבצים קצרים של כמה שניות, להחזיק מכונה כזו דולקת באוויר זה בזבוז של חומרה ועדיף לפנות לשירותים מנוהלים.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="microsoft/VibeVoice-ASR")
print(pipe("שלום"))

הרישיון

רישיון MIT מלא. אפשר להשתמש בו בחינם לשימוש פרטי או מסחרי, לשנות את הקוד ולהטמיע אותו במוצרים שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית של מיקרוסופט בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗