GPT
V

VibeVoice-ASR-Streaming-1.5B

קוד פתוח

microsoftmit2026-09-02

  • transformers
  • safetensors
  • vibevoice
  • ASR
  • Transcription

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל תמלול בהזרמה שמזהה מי דיבר ומה נאמר בזמן אמת. הוא תומך בהזרקת מילים מותאמות אישית לעשר שפות, אבל עברית לא ברשימה.

  • 2.8Bפרמטרים
  • 5.3 GBמשקל הקבצים
  • 1,959הורדות בחודש
  • 48לייקים

מה זה

מיקרוסופט שחררו מודל לתמלול אודיו שמתוכנן לעבוד בהזרמה ישירה, כלומר תוך כדי שמקבלים את הקול. הוא עושה שני דברים במקביל, גם ממיר את הדיבור לטקסט וגם משייך כל משפט לדובר הספציפי שאמר אותו. זה חוסך את הצורך לחבר מודל תמלול נפרד למודל זיהוי דוברים, שרשרת שבדרך כלל מוסיפה עיכוב ומסבכת את הצינור.

נקודה שימושית נוספת היא התמיכה ברשימות מילים ייעודיות שמעבירים לו מראש. זה עוזר לו לקלוט שמות של אנשים, מונחים מקצועיים וסלנג טכני שלרוב נדרסים במודלי דיבור כלליים. המודל מכסה עשר שפות, בהן אנגלית, סינית, צרפתית, ספרדית, גרמנית ויפנית.

מתאים ל

  • תמלול פגישות מרובות משתתפים

    זיהוי הדובר במקביל לתוכן מאפשר לייצר פרוטוקול חי באנגלית או שפות נתמכות אחרות בלי לחבר מודלים שונים.

  • הכתבה קולית למערכות טכניות

    התמיכה בהזנת מונחים מראש מונעת עיוות של שמות קוד, ספריות ומילים מקצועיות בזמן הזרמת השמע.

  • כתוביות חיות לשידורי וידאו

    עיבוד בהזרמה מאפשר לייצר טקסט ישירות מתוך האודיו הנכנס בעיכוב נמוך לשפות כמו אנגלית וספרדית.

איפה זה נופל

הבעיה המרכזית עבור פיתוח מקומי היא היעדר עברית. הוא מכסה עשר שפות בלבד, ועברית אינה חלק מהן. בנוסף, מודלים של תמלול בהזרמה רגישים מאוד לקטיעות דיבור, רעשי רקע ואנשים שנכנסים זה לדברי זה. היכולת להפריד דוברים בזמן אמת נוטה להישבר בשיחות מרובות משתתפים, ולכן חובה לבדוק אותו על הקלטות אמיתיות של המוצר שלכם לפני שמסתמכים על שיוך הדוברים.

אותה משפחה

VibeVoice-ASR-Streaming יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לתמלול שיחות בעברית?

לא. המודל תומך בעשר שפות ספציפיות, ביניהן אנגלית, סינית, ספרדית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית ורוסית. עברית אינה נתמכת כלל ולא תעבוד כאן.

כמה זיכרון וידאו צריך כדי להריץ אותו בהזרמה?

הקבצים שוקלים 5.3 גיגה בייט ומכילים כמעט 2.8 מיליארד פרמטרים. בפועל תצטרכו כרטיס מסך עם שמונה גיגה בייט זיכרון לפחות כדי לטעון אותו, ועדיף שנים עשר גיגה כדי לעבד תעבורת אודיו שוטפת בלי קריסות.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.3 גיגה בייט, עם כמעט 2.8 מיליארד פרמטרים בפועל למרות השם שמציין 1.5B. המשמעות היא שתצטרכו כרטיס מסך עם לפחות שמונה עד שנים עשר גיגה זיכרון כדי להחזיק אותו בנוחות לצד תהליכי ההזרמה, במיוחד אם מריצים אותו בדיוק מלא.

הקוד עצמו יושב בגיטהאב ומבוסס על transformers, כך שהאינטגרציה לתוך תשתית פייתון קיימת פשוטה למדי. אם אתם בונים שירות שצריך תגובה מהירה בלי לשלוח שמע לשרתים חיצוניים, שווה להרים אותו לבד. אם אין לכם חומרה ייעודית לתהליכי זמן אמת, שירות ענן יהיה יציב וזול יותר.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="microsoft/VibeVoice-ASR-Streaming-1.5B")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון MIT. זה אומר שמותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים וקוד סגור, בלי לשלם תמלוגים ובלי חובת שיתוף של השינויים שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של מיקרוסופט בקבצים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗