GPT
V

VibeVoice-ASR-HF

קוד פתוח

microsoftmit2026-03-02

  • transformers
  • safetensors
  • vibevoice_asr
  • automatic-speech-recognition
  • ASR

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

תמלול אודיו של שעה שלמה בריצה אחת שמחלץ גם מי דיבר ומתי. מתאים למי שחייב דיאריזציה מובנית והזרקת מונחים מראש בלי לפרק קבצים לחתיכות קטנות.

  • 8.3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 51,738הורדות בחודש

מה זה

המודל הזה לוקח הקלטה של עד שישים דקות ומבצע במעבר בודד תמלול, זיהוי דוברים וסימון זמנים. במקום לחתוך את האודיו למקטעים קצרים ולאבד את ההקשר של השיחה, הוא שומר על רצף שמאפשר לעקוב אחרי הדוברים לאורך זמן. הפלט מיוצר ישירות כמבנה דמוי ג'ייסון עם חלוקה לדוברים, שעות ותוכן, ויש לו יכולת לקבל מילות מפתח כדי לדייק שמות טכניים או מונחים ספציפיים.

במבחני ביצועים הוא מציג ממוצע שגיאות מילים של 7.77 אחוזים, אבל ההבדלים בין המבחנים חדים. בהקלטות נקיות כמו ליבריספיץ' הוא עומד על 2.20 אחוזים, בזמן שבשיחות מורכבות מרובות משתתפים כמו מבחן אמי הוא מגיע ל־17.20 אחוזי שגיאה. זה אומר שאיכות התמלול בפועל תלויה מאוד ברמת הרעש ובכמות הדוברים שמדברים ביחד.

מתאים ל

  • תמלול ישיבות מרובות משתתפים

    הוא מזהה מי דיבר ומתי לאורך שעה שלמה בלי לפצל את האודיו לחלקים.

  • תמלול שיחות עם מושגים ייחודיים

    אפשר להזין לו מראש רשימת מונחים מקצועיים ושמות כדי למנוע טעויות זיהוי.

  • בניית כתוביות לתוכן ארוך

    המודל פולט חותמות זמן מובנות יחד עם הטקסט בריצה אחת חסכונית.

איפה זה נופל

הכרטיס מדגיש תמיכה בשפות כמו אנגלית, סינית, ספרדית וגרמנית, אבל עברית לא מופיעה ברשימת השפות המוגדרות שלו. לפני שאתם בונים עליו למערכת ישראלית, תצטרכו לבדוק אם הוא בכלל מתמודד עם עברית או מערבב ג'יבריש. בנוסף, המודל מייצר פלט טקסטואלי שמנסה לחקות ג'ייסון, ובתיעוד נכתב במפורש שאם הפיענוח נכשל הוא פשוט מחזיר טקסט גולמי, מה שמחייב אתכם לכתוב מנגנוני הגנה בקוד למקרה שהפלט נשבר באמצע.

אותה משפחה

VibeVoice-ASR יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יתמלל שיחה בעברית?

השפות המדווחות כוללות אנגלית, סינית, צרפתית, גרמנית, ספרדית, פורטוגזית, יפנית וקוריאנית, ועברית אינה מופיעה ברשימה. למרות שהמפרסמים מציינים תמיכה ביותר מחמישים שפות, בלי בדיקה מקדימה על הקלטות מקומיות לא כדאי להסתמך עליו לעברית.

מה קורה אם הזיכרון בכרטיס המסך לא מספיק?

אפשר להקטין את גודל מקטעי הטוקנייזר בזמן הקריאה לריצה כדי לצמצם את צריכת הזיכרון. זה יאפשר לעבד קבצים ארוכים גם על חומרה צנועה יותר בלי לקבל שגיאות חוסר זיכרון.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־15.5 ג'יגה בייט עם 8.3 מיליארד פרמטרים, מה שאומר שתצטרכו כרטיס מסך עם לפחות 24 ג'יגה בייט זיכרון כדי לטעון אותו, או לחלופין להשתמש בקוונטיזציה. ברירת המחדל מעבדת בלוקים של 60 שניות באודיו של 24 קילו־הרץ, אבל אפשר להקטין את גודל הבלוק אם נגמר לכם הזיכרון בכרטיס.

אם אתם צריכים רק תמלול נקודתי בלי לנהל תשתית כבדה, עדיף להשתמש בנקודת קצה מנוהלת בענן של מיקרוסופט או ספק אחר. הרצה מקומית משתלמת כשיש לכם נפח עבודה קבוע, חומרה מתאימה, או צורך לשמור את ההקלטות ברשת המקומית של הארגון.

from transformers import pipeline

pipe = pipeline("audio-text-to-text", model="microsoft/VibeVoice-ASR-HF")
print(pipe("שלום"))

הרישיון

רישיון MIT פתוח ומתיר כמעט הכל. מותר להריץ, לשנות, לשלב בתוך מוצרים מסחריים ולהפיץ מחדש, כל עוד שומרים על הודעת זכויות היוצרים המקורית של מיקרוסופט. אין שום מגבלה מסחרית או דרישה לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗