GPT
V

VibeVoice-Realtime-0.5B

קוד פתוח

microsoftmit2025-12-04

  • transformers
  • safetensors
  • vibevoice_streaming
  • Realtime TTS
  • Streaming text input

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

המודל הזה יודע להתחיל להקריא טקסט תוך כ־300 מילישניות, עוד בזמן שהמשפט זורם אליו מהשרת. הוא מתאים למי שבונה סוכן קולי באנגלית וצריך דיבור מהיר בלי לחכות לסוף התשובה.

  • 1Bפרמטרים
  • 1.9 GBמשקל הקבצים
  • 567,266הורדות בחודש
  • 1,280לייקים

מה זה

הארכיטקטורה מחברת בין מודל שפה של Qwen2.5 בנפח חצי מיליארד פרמטרים, מקודד אקוסטי מבוסס VAE, וראש דיפוזיה קטן שמייצר את גלי הקול. במקום לחכות לפסקה שלמה, הוא מעבד מקטעי טקסט נכנסים וממשיך לרנדר את השמע ברקע תוך כדי תנועה, בקצב דגימה נמוך של 7.5 הרץ שמפחית את העומס החישובי.

במבחני דיוק על טקסט נקי באנגלית הוא הגיע לשיעור שגיאות מילים של 2.00 אחוזים ב־LibriSpeech ו־2.05 אחוזים ב־SEED, לצד דמיון דובר של 0.695 ו־0.633 בהתאמה. בפועל, המספרים האלה מראים שהוא שומר על הגייה מדויקת למדי ועל אופי קול עקבי, אבל הוא מוגבל לדובר יחיד בלבד ולא כולל את מנגנון ריבוי הדוברים שקיים בגרסאות הגדולות של המשפחה.

מתאים ל

  • סוכן קולי בזמן אמת

    חיבור ישיר לפלט של מודל שפה, כדי שהמשתמש ישמע תשובה תוך 300 מילישניות בלי להמתין לפסקה כולה.

  • הקראת עדכונים חיים

    הזרמת טקסט מתעדכן באנגלית, כמו מבזקים או נתונים פיננסיים, ישירות לשידור קולי רציף.

  • הקראת מאמרים קצרים

    הקראה רציפה של תוכן טקסטואלי עד 10 דקות בקול עקבי ובמשאבי מחשוב נמוכים.

איפה זה נופל

הוא לא תומך בעברית. המודל אומן על אנגלית בלבד, וכל שפה אחרת תפיק תוצאות לא צפויות או מלמול חסר פשר. הוא מוגבל להקראה של עד עשר דקות ברצף, ותומך רק בדובר יחיד.

אסור לזרוק אליו טקסט גולמי בלי סינון מוקדם. הוא נכשל לחלוטין על קטעי קוד, נוסחאות מתמטיות או סימנים מיוחדים, ומחייב עיבוד מקדים שינרמל את הטקסט למילים כתובות. בנוסף, הוא כולל סימן מים בלתי נשמע ודיסקליימר קולי מובנה שמודיע שהקטע נוצר בבינה מלאכותית, מה שיפריע למי שמתכנן להשתמש בו ישירות מול לקוחות בלי לטפל בזה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בשביל להקריא עברית?

לא. המודל אומן על אנגלית בלבד. הרצת טקסט בעברית תוביל לפלט משובש, שגיאות הגייה או ג'יבריש מוחלט.

האם אפשר לשכפל קולות שונים או להחליף דובר?

הגרסה הספציפית הזו תומכת בדובר יחיד בלבד. אם אתם צריכים כמה דוברים או שיחה מרובת משתתפים, תצטרכו להסתכל על הגרסאות הגדולות יותר בסדרה.

איך מחברים אותו לפלט של מודל שפה קיים?

מזרימים אליו את הטוקנים דרך חיבור WebSocket מקומי. המודל מעבד את הטקסט בחלונות קצרים ומייצר קול במקביל ליצירת התשובה.

איך מריצים

המשקלים שוקלים 1.9 גיגה־בייט בפורמט bfloat16, כך שאפשר להריץ אותו בקלות על כל כרטיס מסך מודרני עם שמונה גיגה זיכרון, ואפילו על מחשב מקומי סביר. החיבור נעשה ישירות דרך ספריית transformers וקוד ייעודי ב־WebSocket להזרמת טקסט ושמע בזמן אמת.

אם אתם צריכים רק דיבור סטטי באנגלית ולא מערכת שיחה חיה, עדיף להשתמש ב־API מנוהל ולחסוך תחזוקת שרתים. ההרצה העצמאית משתלמת בעיקר כשאתם מחברים אותו ישירות ל־LLM שפולט טוקנים, וחייבים זמן תגובה של מאות מילישניות בלי תלות ברשת חיצונית.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="microsoft/VibeVoice-Realtime-0.5B")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 1.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות שוחררו תחת רישיון MIT, שמתיר שימוש מסחרי, שינוי והפצה כמעט ללא הגבלה, בתנאי שמשאירים את הקרדיט המקורי. עם זאת, בתוך דף המודל מיקרוסופט מציינת שהשחרור נועד לצורכי מחקר בלבד, אוסרת על שימושים של התחזות וזיוף קול, וממליצה שלא לשלב אותו במוצרים חיים ללא בדיקות נוספות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗