GPT
V

VibeVoice-7B

קוד פתוח

vibevoicemit2025-09-04

  • safetensors
  • vibevoice
  • Podcast
  • text-to-speech
  • en

המודל מייצר דיאלוגים מרובי דוברים ברצף של עד 45 דקות ישירות מטקסט. מי שמחפש הפקת פודקאסטים או שיחות שלמות באנגלית ובסינית ימצא כאן שילוב נדיר בין מודל שפה לראש דיפוזיה קולי.

  • 9.3Bפרמטרים
  • 17.4 GBמשקל הקבצים
  • 32,942הורדות בחודש
  • 213לייקים

מה זה

במקום לעצור אחרי משפט או שניים, המודל הזה מתמודד עם שיחות ארוכות של עד 4 דוברים שונים ושומר על זהות הקול שלהם לאורך זמן. הבסיס שלו הוא מודל שפה מסוג Qwen2.5 שמבין את ההקשר הטקסטואלי ואת חילופי הדוברים, לצד ראש דיפוזיה של כ־600 מיליון פרמטרים שמייצר את האודיו בפועל.

החידוש המרכזי כאן הוא טוקנייזרים של אודיו בקצב נמוך של 7.5 הרץ, עם דחיסה של פי 3,200 מקלט של 24 קילוהרץ. הדחיסה הזו מקצצת משמעותית את החישוב ומאפשרת למודל לעבד רצפים ארוכים בחלון הקשר של 32,768 טוקנים בלי להתפרק.

מתאים ל

  • הפקת פודקאסטים מטקסט

    יצירת שיחה רציפה בין עד ארבעה קולות שונים לאורך עשרות דקות.

  • סימולציות שיחה באנגלית

    בניית דיאלוגים ארוכים ועקביים להדרכות או משחקים בלי לחתוך משפטים.

  • מחקר של סינתזת דיבור

    בדיקת ארכיטקטורת דיפוזיה עם טוקנייזר קולי בקצב נמוך במיוחד.

איפה זה נופל

הבעיה המרכזית למפתח הישראלי היא היעדר עברית. המודל אומן רק על אנגלית וסינית, וטקסט בשפות אחרות יניב פלט משובש או לא מובן. בנוסף, הוא לא יודע לייצר דיבור חופף שבו שני אנשים מדברים יחד, ואינו כולל רעשי רקע, מוזיקה או אפקטים. המפתחים גם הטמיעו הודעה קולית וסימן מים בלתי נשמע בכל פלט, כך שאי אפשר להוציא ממנו תוכן נקי לגמרי בלי התערבות.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן אך ורק על אנגלית וסינית. הזנת טקסט בעברית תגרום לפלט פגום, ג'יבריש או שתיקה.

אפשר להשתמש בו לשיחות חיות בזמן אמת?

לא. המודל אינו מיועד להסקה בזמן אמת או להמרת קול בשיחות וידאו וטלפון. מדובר במודל כבד שמייצר קבצי אודיו ארוכים מראש.

למה יש הודעה מוקלטת בתוך האודיו?

החוקרים שתלו הצהרה קולית אוטומטית בכל פלט כדי להבהיר שמדובר בתוכן שנוצר על ידי מחשב. זה מנגנון הגנה מובנה נגד התחזות וזיוף קולות.

איך מריצים

בפועל אתם מורידים 17.4 ג'יגה בייט של משקלים בדיוק bfloat16, מה שאומר שצריך כרטיס מסך עם לפחות 24 ג'יגה בייט זיכרון כדי להעלות את 9.3 מיליארד הפרמטרים ולהריץ הסקה. השילוב של מודל שפה וראש דיפוזיה דורש כוח חישוב משמעותי, כך שכרטיסים ביתיים פשוטים ייחנקו כאן במהירות.

אם אתם צריכים רק קטעים של דקה או קריינות בסיסית, חבל להשקיע בברזלים האלה ועדיף לשלוח בקשה ל־API קיים. ההרצה העצמית פה משתלמת רק כשמייצרים שיחות ארוכות ומורכבות שדורשות עקביות בין כמה דוברים.

pip install -U huggingface_hub
hf download vibevoice/VibeVoice-7B

הרישיון

הרישיון הרשמי בקוד הוא MIT, שמתיר שימוש מסחרי, שינוי והפצה בלי תמלוגים. עם זאת, היוצרים ממיקרוסופט מציינים בפירוש שהשחרור נועד למחקר בלבד, וממליצים לא להכניס אותו למוצרים מסחריים בלי בדיקות נוספות. בנוסף, חל איסור מפורש על זיוף קולות ללא הסכמה, שיבוט קול בזמן אמת והפצת מידע כוזב.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗