GPT
V

VibeVoice

רץ בדפדפן

yasserrmdרישיון לא דווח2025-08-26

  • gradio

היישום ממיר תסריטי שיחה כתובים לקובץ אודיו רב-דוברים. הוא מיועד למי שרוצה להפיק דיאלוגים מדוברים או פודקאסטים קצרים ישירות מהדפדפן.

  • הורדות בחודש
  • 179לייקים

מה זה

מדביקים טקסט של תסריט בתיבת ההזנה, מגדירים בין דובר אחד לארבעה דוברים, ובוחרים קול לכל אחד מהם. המערכת מחזירה נגן עם קובץ שמע שלם שכולל את חילופי הדברים, לצד תיבת תיעוד שמציגה את מהלך העבודה.

מאחורי הקלעים רץ מנוע שמבוסס על שילוב של מודלי שפה ועיבוד קול, כולל גרסאות של VibeVoice ודגמי Qwen שרשומים בהגדרות הקוד. בממשק יש לשונית של תסריטים לדוגמה מקובצי טקסט מוכנים, כך שאפשר לטעון שיחה קיימת בלחיצה אחת ולבדוק איך המודלים מחלקים את התפקידים.

מתאים ל

  • הפקת פודקאסטים קצרים

    המרת תסריט כתוב לשיחה קולית מרובת משתתפים בלי צורך באולפן או בשחקני קול.

  • בדיקת דיאלוגים

    האזנה לתסריט שיחה בין שניים לארבעה דוברים כדי לבדוק קצב וזרימה לפני הפקה מלאה.

  • השוואת מודלי דיבור

    בחינת ביצועי הקול של מודלי VibeVoice מול משקלי Qwen שונים על אותו הטקסט.

איפה זה נופל

אם תשכחו לבחור קול מוגדר לאחד המשתתפים או שתנסו להריץ שיחה עם יותר מארבעה אנשים, הריצה תיעצר בשגיאה מפורשת. המודלים שמוגדרים בקוד מאומנים באנגלית ובסינית, כך שאין שום הבטחה או בדיקה שהם יצליחו להפיק עברית בצורה הגיונית. בנוסף, לעיתים המודל מסיים את הריצה בלי להחזיר אודיו בכלל, מה שמחייב לנסות שוב מאפס.

שאלות
נפוצות

האם השימוש בחינם?

כן, ההדגמה פתוחה לשימוש חופשי בדפדפן דרך Hugging Face Spaces. אין דרישת תשלום או מנוי כדי להריץ את התסריטים.

כמה זמן לוקח לייצר אודיו?

הזמן משתנה לפי אורך התסריט ומצב המעבד הגרפי. מאחר שמדובר בחומרת zero-a10g שמופעלת לפי דרישה, ייתכן עיכוב של כמה עשרות שניות אם המעבד היה כבוי.

האם אפשר להריץ את זה מקומית?

הקוד פתוח ומשתמש בספריות מוכרות כמו transformers, librosa ו־soundfile. כדי להריץ אצלכם תצטרכו להתקין את התלויות, להוריד את המשקלים ולהחזיק מחשב עם מעבד גרפי חזק.

האם זה תומך בעברית?

המודלים שמופיעים בקוד כוללים גרסאות של VibeVoice ו־Qwen, שאינם מותאמים לקריינות עברית. סביר מאוד שטקסט בעברית ייכשל, יג'ברש או ייקרא במבטא זר לא מובן.

איך משתמשים

בוחרים מודל מתוך הרשימה הנגללת, קובעים את מספר הדוברים, משייכים לכל משתתף קול, ומזינים את התסריט או בוחרים דוגמה אקראית. אם רוצים לשלוט בדיוק, פותחים את תפריט ההגדרות המתקדמות ומשנים את ה־cfg scale, ואז לוחצים על יצירה. היישום רץ על חומרת zero-a10g שמקצה מעבד גרפי לפי דרישה, כך שייתכן זמן המתנה קצר להתנעת המעבד לפני תחילת הפקת הקול בפועל.

הרישיון

הרישיון של היישום לא דווח בקוד או בהגדרות. במצב כזה אין אישור מפורש לשימוש מסחרי בקבצים שנוצרים, ואין לדעת אילו זכויות שמורות למפתח או מה מעמדו של התוכן שנשלח לשרת.

הרישיון המלא ב־Hugging Face ↗