GPT
V

anycoderapps/VibeVoice-Realtime-0.5B

רץ בדפדפן

anycoderappsרישיון לא דווח2025-12-04

  • gradio

הדגמת רשת שממירה טקסט לדיבור בזמן אמת על בסיס מודל קטן של מיקרוסופט. מתאים למי שרוצה לבדוק איכות קול והשהיה בלי להתקין סביבת פיתוח.

  • הורדות בחודש
  • 188לייקים

מה זה

אתם כותבים טקסט בתיבה, בוחרים דובר מתוך רשימה וקובעים ערך במחוון ששולט על ההיצמדות להנחיה. בתמורה מקבלים קובץ שמע מרונדר ישירות בדפדפן, לצד חיווי על מצב הריצה. בממשק משולבות דוגמאות מוכנות מראש שמאפשרות ללחוץ ולשמוע תוצאות מיד בלי להקליד.

מאחורי הקלעים רץ המודל microsoft/VibeVoice-Realtime-0.5B שמיועד להזרמת שמע, יחד עם שימוש ברכיבי עיבוד שפה שקשורים ל־Qwen2.5-1.5B. הקוד מקובע לחמישה צעדי הסקה בלבד, מה שמכוון בעיקר למהירות תגובה גבוהה על חשבון שחזור מדויק של כל פרט בצליל.

מתאים ל

  • בדיקת איכות קול

    שמיעת דוגמאות שמע מהמודל של מיקרוסופט כדי להבין אם הוא מתאים ליישום שלכם.

  • הערכת מהירות תגובה

    בדיקה מהירה של קצב יצירת הדיבור בחמישה צעדים לפני שמורידים את המשקלים למחשב.

  • השוואת דוברים

    מעבר בין הדמויות ברשימה ובחינת ההשפעה של מחוון ההנחיה על אופי הקול.

איפה זה נופל

ההגדרה בקוד נועלת את תהליך הדיפיוזיה על חמישה צעדים בלבד, כך שאי אפשר להעלות את איכות האודיו גם אם המחשב מאפשר זאת. בנוסף, חומרת שיתוף דינמית אומרת שאין כאן בדיקה אמיתית של שיהוי מקומי, כי זמני הטעינה לזיכרון הגרפי משתנים בכל קריאה. הממשק נשען על קולות מוגדרים מראש ולא מאפשר להעלות דגימת קול משלכם כדי לשכפל אותה.

שאלות
נפוצות

האם צריך לשלם כדי להשתמש באפליקציה?

לא, השימוש בדפדפן פתוח לחלוטין ללא תשלום. אין צורך להזין אמצעי תשלום, אבל זמינות המשאבים תלויה בעומס על השרת המשותף.

כמה זמן לוקח לשמע להיווצר?

העיבוד עצמו קצר מאוד בזכות חמישה צעדי הסקה ומאיץ ייעודי. עם זאת, ייתכן עיכוב של כמה שניות בכל פעם שהקוד טוען את המודל לכרטיס המסך מחדש.

מה קורה עם הטקסט שמקלידים שם?

הטקסט נשלח לשרת שמריץ את הממשק כדי לעבד את גל הקול. הרישיון ומדיניות השמירה של הנתונים לא צוינו במפורש, אז לא כדאי להזין לשם מידע רגיש או פרטי.

במה הממשק הזה שונה מהרצת המודל לבד?

כאן הפרמטרים נעולים על ברירות מחדל מסוימות, כמו מספר צעדים נמוך ורשימת דוברים סגורה. בריצה עצמאית בקוד שלכם יש לכם שליטה מלאה על איכות הדגימה, אורך הקטעים וחומרת הקצה.

איך משתמשים

העבודה ישירה לחלוטין. מזינים משפט, לוחצים על כפתור יצירת הדיבור ומחכים שהנגן יתמלא. המערכת רצה על חומרת zero-a10g שמקצה מעבד גרפי רק בזמן הפעולה עצמה ומעבירה את המודל למעבד הרגיל בסיום. בגלל ההקצאה הדינמית הזו, אם המעבד הגרפי בדיוק נתפס על ידי משתמש אחר, תיתקלו בהמתנה קצרה עד שהשמע יתחיל להיווצר.

הרישיון

הרישיון של המרחב עצמו לא דווח בעמוד הפרויקט. בלי רישיון מוגדר אי אפשר לדעת אם מותר להשתמש בפלט לצרכים מסחריים, ורצוי לבדוק בנפרד את תנאי השימוש של המודל המקורי של מיקרוסופט לפני שלוקחים את התוצרים הלאה.

הרישיון המלא ב־Hugging Face ↗