GPT
V

Steveeeeeeen/VibeVoice-Large

רץ בדפדפן

Steveeeeeeenרישיון לא דווח2025-09-01

  • gradio

הכלי מייצר שיחות אודיו מרובות דוברים מתוך תסריט כתוב. אם אתם מחפשים להפיק פודקאסט קצר עם עד ארבעה קולות שונים ישירות מהדפדפן, הוא מיועד לזה בדיוק.

  • הורדות בחודש
  • 85לייקים

מה זה

מזינים תסריט טקסטואלי, קובעים את מספר הדוברים מבין אחד עד ארבעה, ובוחרים קול מתאים לכל דמות מתוך תפריט מוגדר מראש. בסיום התהליך מקבלים קובץ אודיו מלא שמשלב את כל הדוברים לפי הטקסט שהוזן, יחד עם חלונית שמציגה הודעות ויומני ריצה. הממשק מציע גם דוגמאות טקסט מוכנות מראש מקבצים חיצוניים, כדי שתוכלו לבדוק את התוצאה בלי לכתוב שורות בעצמכם.

מאחורי הקלעים פועל שילוב של שני מודלים עיקריים, aoi-ot/VibeVoice-Large יחד עם Qwen/Qwen2.5-1.5B לעיבוד השפה, כשהמערכת משתמשת בספריית vibevoice ייעודית ובמעבדי אודיו מבוססי librosa ו־soundfile. יש גם גישה להגדרות יצירה מתקדמות יותר כמו סליידר לשינוי ה־cfg_scale.

מתאים ל

  • הפקת פודקאסט מרובה משתתפים

    יצירת קטעי דיאלוג מומחזים לעד ארבעה דוברים שונים מתוך תסריט כתוב.

  • המחזת טקסטים ודיאלוגים

    בדיקת זרימה של שיחות כתובות והפיכתן לקולות נפרדים להאזנה מהירה.

  • בדיקת תסריטי אודיו מוכנים

    טעינת דוגמאות טקסט בלחיצה אחת כדי לבחון איך קולות שונים משתלבים יחד.

איפה זה נופל

הכלי מוגבל לחלוטין לקולות המוגדרים מראש בתפריטים, ואי אפשר להקליט או להעלות דגימות קול משלכם. בנוסף, חובה לבחור לפחות דובר אחד ועד ארבעה, והמערכת תיעצר עם שגיאה אם תשאירו שדה תסריט ריק או אם טעינת קובץ האודיו של הדובר תיכשל. הקוד חושף גם נקודת תורפה שבה המודל פשוט מסיים ריצה בלי להחזיר שום אודיו, מצב שמאלץ אתכם להריץ את הכל מחדש.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום כלשהו?

האפליקציה פתוחה לשימוש בדפדפן ללא דרישת תשלום וללא צורך בהרשמה מיוחדת. היא מתבססת על החומרה השיתופית של הפלטפורמה המארחת. כל עוד המשאבים פנויים, אפשר להריץ אותה ישירות.

מה קורה עם הטקסט שאני מדביק בממשק?

הטקסט שלכם מועבר ישירות למודל שרץ על השרת כדי ליצור את קובץ הקול. אין בממשק הצהרת פרטיות ייעודית, ולכן לא כדאי להעלות תסריטים שמכילים מידע סודי או אישי.

כמה זמן לוקח לאודיו להיווצר בפועל?

משך היצירה תלוי באורך התסריט שהזנתם ובזמינות המיידית של מעבד ה־A10G. מאחר שמדובר בחומרה שמפעילה את עצמה לפי צורך, עשויה להיות השהיה ראשונית קצרה עד שהמודל נטען לזיכרון ומתחיל בעיבוד.

האם אפשר לקחת את הקוד ולהריץ אותו באופן עצמאי?

הקוד נשען על חבילות סטנדרטיות יחסית כמו gradio ו־transformers לצד רכיבי vibevoice ייעודיים. מי שיש לו סביבת עבודה מתאימה עם כרטיס גרפי תואם יכול להריץ את app.py באופן מקומי, אך יידרשו משאבי חומרה חזקים להרצת המודלים.

איך משתמשים

בוחרים את מספר הדוברים, משייכים קול לכל אחד, מדביקים את התסריט בתיבה ולוחצים על כפתור הייצור. אפשר גם ללחוץ על כפתור הדוגמה האקראית כדי למלא את השדות מיד. היישום רץ על גבי חומרת zero-a10g, מה שמבטיח כוח עיבוד גרפי סביר שמתעורר לפי דרישה, אבל בגלל שמדובר במשאב משותף ייתכן זמן המתנה מסוים אם יש עומס של בקשות.

הרישיון

ליישום לא דווח רישיון כלל, מה שאומר שאין מידע ברור לגבי תנאי השימוש המסחריים או זכויות היוצרים על האודיו שמופק בו. במצב כזה, מוטב להיזהר ולא להזין טקסטים רגישים או להסתמך עליו לפרויקטים מסחריים.

הרישיון המלא ב־Hugging Face ↗