GPT
V

VibeVoice-Large

קוד פתוח

aoi-otmit2025-09-04

  • vibevoice
  • safetensors
  • Podcast
  • text-to-speech
  • en

הפקת שיחה מרובת דוברים באודיו ארוך ישירות מטקסט. פתרון מבוסס מודל שפה ודיפיוז'ן שמחזיק עד ארבעה קולות שונים ברצף.

  • 9.3Bפרמטרים
  • 17.4 GBמשקל הקבצים
  • 2,610הורדות בחודש
  • 236לייקים

מה זה

המודל הזה לוקח טקסט של דיאלוג ומייצר ממנו אודיו רציף עם חלוקת תפקידים טבעית בין עד ארבעה דוברים שונים. במקום גישות ישנות שמייצרות משפט בודד ומחברות את הקבצים בעריכה, הוא מתבסס על מודל השפה Qwen2.5 כדי להבין את ההקשר של השיחה ואת זרימת חילופי הדברים, ומשלב ראש דיפיוז'ן של כ־600 מיליון פרמטרים שמייצר את פרטי האודיו האקוסטיים.

החידוש המרכזי בארכיטקטורה הוא שימוש בטוקנייזרים ייעודיים, אקוסטי וסמנטי, שרצים בקצב דגימה נמוך במיוחד של 7.5 הרץ ומבצעים דחיסה פי 3200 מאודיו של 24 קילוהרץ. הדחיסה הזו מאפשרת לו להתמודד עם רצפים ארוכים מאוד בלי לפוצץ את הזיכרון, כשהגרסה הזו אומנה עם חלון הקשר של עד 32,768 טוקנים ויכולה לייצר כ־45 דקות של דיבור רציף.

מתאים ל

  • הפקת פודקאסטים מטקסט

    יצירת שיחה רציפה באנגלית בין מספר מגישים ישירות מתסריט כתוב.

  • הקראת מחזות ודיאלוגים

    שמירה על עקביות קולית של עד ארבע דמויות לאורך עשרות דקות.

  • מחקר טוקניזציה של אודיו

    בדיקת ארכיטקטורות המשלבות מודלי שפה עם דיפיוז'ן בקצב דגימה נמוך.

איפה זה נופל

הבעיה המרכזית למפתח ישראלי היא השפה. המודל אומן אך ורק על אנגלית וסינית, וטקסט בעברית לא יעבוד או יפיק צלילים לא ברורים ומקולקלים. מעבר לזה, אין לו יכולת לייצר דיבור של שני אנשים שמתפרצים זה לדברי זה בו זמנית, ואין בו תמיכה במוזיקת רקע או רעשי סביבה. הכרטיס גם מציין במפורש שהפלט כולל חותמת מים ואזהרה קולית מובנית שמצהירה שהקטע יוצר על ידי בינה מלאכותית, מה שמגביל מאוד שימוש ישיר באפליקציות מוצר.

שאלות
נפוצות

האם המודל תומך בהפקת דיבור בעברית?

לא. האימון נעשה אך ורק על אנגלית וסינית. הזנה של טקסט בעברית תגרום לפלט שבור או חסר משמעות, וכרגע אין דרך להשתמש בו ישירות לשפה המקומית ללא אימון נוסף.

האם אפשר להשתמש בו לשיחות קוליות בזמן אמת?

ממש לא. מדובר במודל שנועד להפקת קטעים ארוכים אופליין באמצעות מודל שפה ודיפיוז'ן, מה שדורש זמן חישוב משמעותי. הוא לא תוכנן להגיב בשיהוי נמוך.

מה ההבדל בינו לבין גרסת 1.5B?

גרסת ה־Large גדולה בהרבה עם יותר מתשעה מיליארד פרמטרים, אבל מוגבלת לחלון של 32K וייצור של 45 דקות, בעוד גרסת 1.5B מאפשרת חלון כפול של 64K ועד 90 דקות אודיו.

איך מריצים

במשקל של 17.4 ג'יגה בייט וקרוב לתשעה וחצי מיליארד פרמטרים בפורמט bfloat16, תצטרכו כרטיס מסך מקצועי עם לפחות 24 עד 48 ג'יגה בייט זיכרון גרפי כדי לטעון אותו ולהריץ הסקה בצורה סבירה, במיוחד כשמנצלים את מלוא חלון ההקשר.

לפני שרצים להרים שרת ייעודי ויקר, כדאי לשים לב שיש גרסה קלה יותר של מיליארד וחצי פרמטרים שתומכת בחלון גדול יותר של 64K ומייצרת עד 90 דקות. למי שצריך תוצאה מהירה או זמני תגובה קצרים, המודל הזה לא בנוי לשידור חי אלא לעיבוד אופליין כבד של פודקאסטים ושיחות שלמות.

pip install -U huggingface_hub
hf download aoi-ot/VibeVoice-Large

הרישיון

הרישיון הרשום בקוד הוא MIT, שמתיר שימוש מסחרי, שינוי והפצה מחדש. עם זאת, החוקרים של מיקרוסופט ציינו בהמלצות שהמודל מיועד למחקר ופיתוח בלבד ולא מומלץ ליישומים מסחריים בלי בדיקות נוספות, ויש בו הגבלות שימוש נגד זיוף קולות והתחזות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗