GPT
V

ViiTorVoice

רץ בדפדפן

ZzWaterapache-2.02026-06-10

  • gradio

הדגמת רשת המאפשרת לשבט קולות או לערוך קטעי דיבור מוקלטים לפי טקסט חדש. היא מיועדת למי שרוצה לבדוק את יכולות מודל הדיבור ישירות דרך הדפדפן.

  • הורדות בחודש
  • 127לייקים

מה זה

הממשק מחולק לשני מצבי עבודה עיקריים. במצב עריכת קול מעלים הקלטת מקור קצרה, מזינים את הטקסט המקורי שנאמר בה, ומקלידים את הטקסט הערוך שרוצים לקבל במקומו. במצב שיבוט קול מעלים הקלטת ייחוס של הדובר ומזינים טקסט חופשי ליצירה מאפס, לצד בחירת שפת הדיבור.

מאחורי הקלעים המערכת נשענת על המודל ZzWater/ViiTorVoice-NAR, וקוד הממשק שולח בקשות לשרת מרוחק שמריץ את החישובים. למי שרוצה לדייק את התוצאה ישנם פרמטרים מתקדמים כמו מספר צעדי הפקה, סקאלת הנחיה, והנחיות לרגש ולמאפייני דיבור, לצד דוגמאות מובנות שמאפשרות טעינה מהירה של קבצים וטקסטים לבדיקה.

מתאים ל

  • שינוי מילים בהקלטה קיימת

    תיקון טעויות בדיבור מוקלט על ידי החלפת מילים ספציפיות בטקסט מבלי להקליט את כל הקטע מחדש.

  • יצירת דיבור מקול של דובר

    הפקת משפטים חדשים באמצעות דגימת קול קצרה של עד 25 שניות לצורך שמירה על גוון הדיבור.

  • בדיקת המודל לפני הטמעה

    התנסות מעשית ביכולות המודל והפרמטרים שלו דרך דפדפן לפני שמתקינים אותו עצמאית.

איפה זה נופל

ישנה מגבלה קשיחה על אורך האודיו, והוא חייב להיות קצר מ־25 שניות ובפורמט תקין כדי שהקוד יסכים לעבד אותו. מעבר לכך, הממשק דורש כתובת שרת פעילה כדי להריץ את הבקשות, ואם השרת המרוחק אינו זמין או שהחיבור נכשל, מתקבלת שגיאת תקשורת במקום קובץ שמע.

שאלות
נפוצות

האם השימוש בהדגמה כרוך בתשלום?

הפעלת הממשק בדפדפן פתוחה ללא תשלום ואינה דורשת הרשמה מראש. כל עוד השרת המקושר זמין, אפשר לבצע בדיקות ישירות דרך האתר. שימוש במודל באופן עצמאי מחוץ לרשת תלוי במשאבים שלכם.

מה קורה עם קובצי הקול שאני מעלה?

הקבצים מעובדים מקומית בממשק לצורך בדיקת משך הזמן שלהם ולאחר מכן נשלחים אל שרת קצה חיצוני שמבצע את ההפקה. אין להעלות חומרים רגישים או סודיים. מומלץ להשתמש רק בקטעים המיועדים לבדיקה כללית.

האם אפשר להריץ את כל המערכת על המחשב?

הקוד בנוי בעזרת ספריית gradio ומקבל כתובת שרת להפעלת המודל. הרישיון הוא apache-2.0, מה שמאפשר להוריד את הקוד ולהשתמש בו. עם זאת, כדי להריץ את העיבוד מקומית תצטרכו להקים ולהגדיר את שרת המודל בעצמכם.

במה שונה הממשק מהרצה של המודל עצמו?

הממשק משמש רק כשכבת תצוגה גרפית ששולחת בקשות רשת לשרת חיצוני. הוא מגביל את האודיו לעד 25 שניות ומחייב שדות מסוימים כדי למנוע שגיאות. עבודה ישירה מול המודל בקוד מאפשרת גמישות מלאה ושליטה בכל שלבי העיבוד.

איך משתמשים

בוחרים בין לשונית עריכה לשיבוט, גוררים קובץ שמע, כותבים את הטקסט ולוחצים על כפתור ההפקה. אין צורך בחשבון או בהתחברות כדי להתחיל. החומרה שמוגדרת להדגמה עצמה היא מעבד בסיסי, אך הקוד בפועל מתקשר דרך הרשת עם שרת קצה חיצוני שמבצע את העיבוד הקולי בפועל.

הרישיון

הפרויקט מפורסם תחת רישיון apache-2.0, שמאפשר שימוש חופשי ובדיקה של הקוד. עם זאת, הקבצים והטקסטים שמועלים נשלחים אל כתובת השרת שמוגדרת מאחורי הממשק, ולכן אין להעלות הקלטות פרטיות או רגישות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗