GPT
V

VibeVoice-ASR-Streaming-7B

קוד פתוח

microsoftmit2026-09-02

  • transformers
  • safetensors
  • vibevoice
  • ASR
  • Transcription

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל תמלול בהזרמה חיה שמזהה מי דיבר ומה נאמר בו-זמנית. מתאים למי שחייב הפרדת דוברים מיידית ומשלב מונחים טכניים בהתאמה אישית.

  • 8.7Bפרמטרים
  • 16.2 GBמשקל הקבצים
  • 1,449הורדות בחודש
  • 180לייקים

מה זה

מיקרוסופט שחררו מודל זיהוי דיבור שמטפל בשתי בעיות שמודלים רגילים מפרידים ביניהן: תמלול הטקסט ושיוך הדובר בזמן אמת. במקום לתמלל הכל לגוש אחד ואז להריץ מודל דיאריזציה נפרד שגוזל זמן, הוא פולט מי אמר מה תוך כדי שהאודיו מגיע.

בנוסף, יש בו תמיכה במילות מפתח מותאמות אישית. אם האפליקציה שלכם משתמשת בשמות של מוצרים, שמות אנשים או מונחים טכניים נדירים, אפשר להזין אותם מראש כדי שהמודל לא ימציא מילים דומות. הוא תומך בעשר שפות, בהן אנגלית, סינית, צרפתית, גרמנית, ספרדית ועוד כמה שפות מרכזיות.

מתאים ל

  • תמלול שיחות ועידה רב-משתתפים

    מזהה מי אמר מה בזמן אמת בשיחות באנגלית או שפות נתמכות אחרות, בלי מודל דיאריזציה חיצוני.

  • מוקדי שירות לקוחות

    מפריד אוטומטית בין הנציג ללקוח בשידור חי ומזהה שמות מוצרים בעזרת מילות מפתח מוגדרות מראש.

  • כתוביות חיות לשידורים

    מייצר טקסט עם שיוך לדובר ברצף ישר מהמיקרופון, מתאים לשידורים חיים מרובי משתתפים.

איפה זה נופל

החיסרון הברור ביותר לישראלים הוא היעדר עברית. רשימת השפות כוללת עשר שפות בלבד, ורובן אירופיות או אסייתיות, כך שאין מה לבנות עליו לפרויקטים מקומיים. מעבר לזה, הכרטיס לא מציג נתוני ביצועים מפורטים בטקסט אלא מפנה לתמונות ולמאמר, ולכן אי אפשר לדעת מה ההשהיה המדויקת באלפיות שנייה לפני שבודקים בפועל.

אותה משפחה

VibeVoice-ASR-Streaming יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בתמלול שיחות בעברית?

לא. המודל תומך בעשר שפות בלבד: אנגלית, סינית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית, רוסית וספרדית. שימוש באודיו בעברית יפיק ג'יבריש או תמלול שגוי לחלוטין.

מה נותנת התמיכה במילות מפתח מותאמות אישית?

היא פותרת בעיה נפוצה במודלי שמיעה שמתקשים עם סלנג, שמות מותגים או מושגים פנימיים של חברות. אתם מעבירים רשימת מונחים יחד עם האודיו, והמודל מתעדף אותם בזמן הפענוח כדי לא לטעות באיות שלהם.

איך מריצים

עם שמונה נקודה שבעה מיליארד פרמטרים ומשקל קבצים של 16.2 גיגה-בייט, אתם צריכים כרטיס מסך רציני עם לפחות 24 גיגה-בייט זיכרון כדי להריץ אותו בלי לחנוק את המערכת, במיוחד אם רוצים לשמור על השהיה נמוכה בסטרימינג. הוא רץ דרך ספריית transformers ומשתמש בארכיטקטורה ייעודית של מיקרוסופט.

אם אתם לא צריכים שיוך דוברים חי או הזרמה של אודיו ברציפות, להרים שרת GPU ייעודי בשבילו זה יקר ומיותר. במקרים של תמלול קבצים מוקלטים מראש, שימוש ב־API חיצוני של שירות קיים כנראה יעלה לכם פחות כסף וכאב ראש.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="microsoft/VibeVoice-ASR-Streaming-7B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT. המשמעות היא חופש מלא, אתם יכולים לקחת את הקוד והמשקלים, לשלב אותם במוצר מסחרי סגור, לשנות אותם ולהריץ אותם על שרתים שלכם, בלי לשלם תמלוגים ובלי חובה לפתוח את הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗