GPT
V

VibeVoice-1.5B

קוד פתוח

microsoftmit2025-08-25

  • transformers
  • safetensors
  • vibevoice
  • text-to-audio
  • Podcast

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

המודל מייצר דיאלוגים מרובי משתתפים באורך של עד שעה וחצי מטקסט. הוא מתאים למי שצריך שיחה רציפה בין כמה דוברים ולא רק הקראה של משפט בודד.

  • 2.7Bפרמטרים
  • 5.0 GBמשקל הקבצים
  • 281,110הורדות בחודש
  • 2,479לייקים

מה זה

במקום עוד מנוע הקראה שמפיק כמה שניות ומאבד יציבות, המודל הזה מתמקד בשיחות ארוכות ומורכבות עם עד ארבעה דוברים שונים. הבסיס שלו הוא מודל שפה של Qwen2.5 בנפח מיליארד וחצי פרמטרים, שמחובר למנגנון דיפוזיה ולשני טוקנייזרים של אודיו בקצב נמוך מאוד של שבעה וחצי הרץ. המבנה הזה מאפשר לו לעבד הקשר של שישים וארבעה אלף טוקנים בלי לקרוס תחת עומס חישובי.

השילוב בין מודל שפה שמבין את התוכן לבין ראש דיפוזיה של מאה עשרים ושלושה מיליון פרמטרים נותן שליטה טובה בחילופי דוברים ובאינטונציה. בעוד שכלים אחרים דורשים לחתוך טקסט למקטעים ולתפור את האודיו ידנית, כאן אפשר להזין תסריט שלם לפודקאסט ולקבל רצף אחיד ששומר על זהות הקולות לאורך זמן.

מתאים ל

  • הפקת פודקאסטים מסקריפטים

    הוא מחזיק עד שעה וחצי של שיחה וארבעה דוברים שונים בלי לאבד את האחידות של הקולות.

  • דיבוב דיאלוגים למשחקים

    החיבור למודל שפה מאפשר חילופי דברים טבעיים יחסית בין דמויות באנגלית ובסינית.

  • הקראת חומרים לימודיים

    חלון הקשר גדול מאפשר הזנה של טקסטים ארוכים והמרתם לשיחה בין מנחה לתלמיד.

איפה זה נופל

החיסרון הכי בולט הוא השפות. הוא תומך באנגלית ובסינית בלבד, כך שעברית תפיק ג׳יבריש או פלט לא מובן. הוא גם לא מייצר רעשי רקע, מוזיקה או אפקטים, ולא מסוגל להתמודד עם דיבור חופף של כמה אנשים בו זמנית. בנוסף, הקוד מטמיע הצהרה קולית אוטומטית שהקטע הופק בבינה מלאכותית יחד עם חותמת מים דיגיטלית, מה שידרוש מכם התעסקות אם רציתם פלט נקי לחלוטין.

שאלות
נפוצות

האם אפשר להשתמש במודל כדי להקריא טקסטים בעברית?

לא. האימון נעשה אך ורק על אנגלית וסינית. הזנה של עברית תגרום לפלט משובש לחלוטין או לשתיקה.

למה מופיע 1.5B בשם אם המודל מכיל 2.7 מיליארד פרמטרים?

השם מתייחס לגודל של מודל השפה הפנימי, שהוא Qwen2.5 בנפח של מיליארד וחצי. שאר הפרמטרים שייכים לטוקנייזרים ולראש הדיפוזיה שמרכיבים את שאר המערכת.

איך מריצים

למרות השם, מדובר במודל של שניים נקודה שבעה מיליארד פרמטרים בסך הכול, והקבצים שלו שוקלים חמישה גיגה בייט בפורמט bfloat16. כדי להריץ אותו בהקשר המלא של שישים וארבעה אלף טוקנים תצטרכו כרטיס מסך עם זיכרון וידאו מכובד, סביב עשרים וארבעה גיגה בייט, בעיקר אם תרצו לייצר קבצים ארוכים בלי לחנוק את החומרה.

מי שצריך תגובה מהירה לפקודות קצרות או סטרימינג עדיף שיסתכל על גרסת החצי מיליארד פרמטרים שנועדה לזמן אמת, או שיפנה לשירותי ענן חיצוניים. הגרסה הזו מיועדת לעיבוד אצווה של קטעים ארוכים, שבהם זמן הריצה פר שניית אודיו פחות קריטי מהיכולת להחזיק שיחה שלמה.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="microsoft/VibeVoice-1.5B")
print(pipe("שלום"))

הרישיון

הרישיון הרשמי הוא MIT, מה שמתיר שימוש מסחרי, שינוי והפצה בקוד פתוח. יחד עם זאת, החוקרים ממליצים בטקסט לא להשתמש בו במוצרים מסחריים אמיתיים בלי בדיקות נוספות ומייעדים אותו בעיקר למחקר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗