GPT
S

s1-mini — הדגמה

קוד פתוח

fishaudiocc-by-nc-sa-4.02024-04-24

  • gradio

מייצרים כאן דיבור מטקסט עם שכפול קול לפי דגימת שמע קצרה. מיועד למי שרוצה לבדוק את היכולות של משפחת המודלים של Fish Speech דרך הדפדפן.

  • 3.4 GBמשקל הקבצים
  • הורדות בחודש
  • 697לייקים

מה זה

אתם מקלידים טקסט לתוך תיבה ומקבלים קובץ שמע שנוצר ישירות מהמילים שהזנתם. לצד הטקסט אפשר להעלות דגימת קול משלכם יחד עם התמלול המדויק שלה כדי לחקות את גוון הדיבור, או להשתמש במזהה קול קיים שכבר נשמר במערכת. יש כאן גם הגדרות מתקדמות ששולטות באורך המקטעים, בטמפרטורה, במדדי חזרתיות ובכמות הטוקנים שנוצרים.

מתחת לממשק רץ מנוע שמחבר בין מודל טקסט למשמעות לבין מפענח שמע מבוסס dac. הקוד טוען משקלים מתוך המאגר של s1 mini לצד גרסאות שונות של fish speech, כמו גרסה אחת, גרסה אחת נקודה ארבע, גרסה אחת נקודה חמש ודגם שפה ייעודי לקול בשם fish agent. הצימוד הזה ממיר את הטקסט למאפיינים קוליים ובונה מהם גל קול רציף שמנסה לשמור על הטונציה של הדגימה המקורית.

מתאים ל

  • הקראת טקסטים קצרים

    מזינים משפטים ומקבלים קובץ שמע בקול ברירת המחדל כדי לבדוק איך טקסט כתוב נשמע בדיבור חי.

  • בדיקת שכפול קול

    מעלים דגימה של כמה שניות עם תמלול כדי לראות איך המודל מצליח לחקות את גוון הקול.

  • כוונון פרמטרים קוליים

    משחקים עם מדדי יצירתיות וחזרתיות כדי להבין איך ההגדרות משפיעות על טבעיות הדיבור.

איפה זה נופל

נכון לעכשיו העמוד מסומן במצב של שגיאת ריצה, מה שאומר שבפועל אי אפשר להשתמש בו ישירות בדפדפן עד שיוצריו יתקנו את הבעיה בטעינת הקוד או בסביבה. גם כשהוא פועל, שכפול קול דורש התאמה מדויקת מאוד בין קובץ השמע לתמלול שלו, ואם ההקלטה רועשת או קצרה מדי האיכות תרד משמעותית.

בנוסף, הממשק נועד להדגמה של משפטים בודדים או פסקאות קצרות. הוא לא מיועד להפקת ספרים שלמים ברצף, והמודלים שרצים ברקע עלולים להתבלבל בשפות שאינן נתמכות היטב באימון המקורי או בהגייה של שמות מורכבים.

שאלות
נפוצות

האם השימוש בעמוד הזה עולה כסף?

לא, הגישה להדגמה בדפדפן היא בחינם ואינה דורשת תשלום. עם זאת, בגלל מגבלות המשאבים המשותפים, הביצועים מוגבלים לחומרה שהוקצתה לפרויקט.

למה היישום לא מגיב כרגע?

העמוד מדווח על שגיאת ריצה, ולכן הממשק אינו זמין לעבודה כרגע. צריך לחכות שהמפתחים יתקנו את הקוד או את טעינת המשקלים במאגר.

מה קורה לקבצי השמע שאני מעלה?

הקבצים נשלחים לעיבוד על גבי השרת שמריץ את ההדגמה כדי להפיק את הקול החדש. אם יש לכם הקלטות רגישות או פרטיות, עדיף לא להעלות אותן לסביבה ציבורית כזו.

האם אפשר להריץ את המערכת הזו במחשב שלי?

כן, הקוד והמשקלים פתוחים להורדה תחת תנאי הרישיון. כדי להריץ הכל מקומית תצטרכו כרטיס מסך תואם ואת סביבת הפייתון של הפרויקט.

איך מריצים

בפועל נכנסים לדף, מקלידים את הטקסט שרוצים להקריא בתיבה הראשית, ואם רוצים שכפול קול, מעלים קובץ שמע ללשונית הייעודית וכותבים מה נאמר בו. בלשונית ההגדרות המתקדמות אפשר לכוונן ערכים כמו טמפרטורה, גודל מקטעים ומספר סיד אקראי, ואז לוחצים על כפתור הייצור ומחכים לנגן שיציג את התוצאה להאזנה או להורדה.

היישום רץ על גבי מאיץ גרפי בודד מסוג L4, חומרה שאמורה להספיק לעיבוד מהיר יחסית של קטעים קצרים בלי לחכות דקות ארוכות. אין צורך להתקין תוכנה במחשב, אבל אם יש עומס של משתמשים בו זמנית הדברים עלולים להתעכב כי התור מתנהל מול אותו כרטיס.

pip install -U huggingface_hub
hf download fishaudio/s1-mini

הקבצים

7 קבצים במאגר, 3.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מפורסם תחת רישיון cc-by-nc-sa-4.0. המשמעות היא שאתם רשאים להשתמש בו ולשנות אותו לצרכים אישיים או מחקריים בלבד, תוך מתן קרדיט ושיתוף תחת אותם תנאים. שימוש מסחרי מכל סוג אסור לחלוטין, וזה כולל מכירה של קבצי השמע שתפיקו כאן או שילוב שלהם במוצרים מסחריים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗