GPT
F

fish-s2-pro-zero

רץ בדפדפן

artificialguybrother2026-03-10

  • gradio

הדגמה פשוטה להמרת טקסט לדיבור ושכפול קול, המיועדת למי שרוצה לבדוק את היכולות של המודל ישירות בדפדפן. היא מאפשרת להפיק קבצי שמע עם שליטה ברגשות ובסגנון הדיבור.

  • הורדות בחודש
  • 181לייקים

מה זה

אתם מקלידים טקסט ומקבלים קובץ שמע. אפשר להוסיף לטקסט תגיות מיוחדות כמו צחוק או לחישה כדי להשפיע על אופי הדיבור, מתוך מעל 15,000 תגיות שהמערכת מזהה לפי התיעוד.

אם רוצים לשכפל קול, מעלים קובץ קול קצר של חמש עד עשר שניות. אפשר להקליד את התמליל שלו ידנית או לתת למודל Whisper large-v3 לתמלל אותו בלחיצת כפתור, ומשם המודל מסנתז את הטקסט החדש באותו הקול.

מאחורי הקלעים רץ המודל fishaudio/s2-pro בארכיטקטורת Dual-AR שמשתמשת בספריית fish_speech. בממשק יש גם דוגמאות מובנות להרצה מהירה כדי להבין את התחביר של התגיות.

מתאים ל

  • הקראת טקסט עם רגש

    יצירת קריינות שכוללת הפסקות, צחוק או לחישות באמצעות שילוב תגיות בתוך הטקסט.

  • שכפול קול מהיר

    העלאת קובץ קול באורך שניות בודדות כדי לייצר דיבור חדש שנשמע כמו הדובר המקורי.

  • בדיקת המודל לפני הטמעה

    התנסות מעשית ביכולות של s2-pro והגדרות כמו Top-P וטמפרטורה בלי צורך בהתקנה מקומית.

איפה זה נופל

אם אין דיבור ברור בקובץ הקול שהעליתם, Whisper ייכשל בתמלול ולא תוכלו להמשיך בשכפול הקול. הממשק גם לא מייצר שמע אם שדה הטקסט נשאר ריק, והוא מפסיק את הפעולה מיד עם שגיאה.

מעבר לכך, התוצאות תלויות לחלוטין באיכות הקלט הקולי ובפרמטרים המתקדמים כמו טמפרטורה ואורך המקטעים, שלא תמיד מכוונים בצורה אידיאלית כברירת מחדל.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה בדפדפן פתוחה בחינם לכל משתמש דרך Hugging Face Spaces. אין כאן מנוי או תשלום על זמן עיבוד.

כמה זמן לוקח לייצר קטע קול?

זמן ההפקה לוקח בדרך כלל כמה שניות ספורות, בהתאם לאורך הטקסט. לפני שזה מתחיל, המערכת מקצה מעבד גרפי של Zero GPU, כך שאם יש עומס ייתכן עיכוב קל.

האם אפשר להריץ את זה באופן מקומי?

כן, הקוד מושך את המודל ישירות מ־Hugging Face בעזרת ספריית fish_speech. כדי להריץ אצלכם תצטרכו חומרה תואמת עם GPU וסביבת פייתון מוגדרת כראוי.

מה קורה לקבצי האודיו שאני מעלה?

הקבצים נשלחים ישירות לממשק ה־Gradio לצורך ניתוח התמלול והקול בזמן הריצה. הם משמשים נקודתית להפקה הנוכחית על פי הקוד, אך אין כאן התחייבות לאחסון או למחיקה מעבר לתפעול הרגיל של השרת.

איך משתמשים

מקלידים את הטקסט הרצוי, פותחים את תפריט שכפול הקול אם רוצים להעלות דוגמת שמע, ולוחצים על כפתור ההפקה. אין צורך בהרשמה או בהתחברות מיוחדת.

האפליקציה רצה על חומרת zero-a10g שמקצה כרטיס גרפי דינמי רק בזמן הריצה. אם האתר עמוס, אתם עלולים להמתין בתור עד שמשאב ה־GPU יתפנה, אבל החישוב עצמו מהיר ומציג הערכת זמן בשניות עם תחילת העבודה.

הרישיון

הקוד והמודל מופצים תחת רישיון ייעודי בשם FISH AUDIO RESEARCH LICENSE, המוגדר במערכת כרישיון מסוג other. זהו רישיון מחקרי ולא רישיון קוד פתוח חופשי רגיל, כך שהוא לא מיועד לשימוש מסחרי ישיר.

הרישיון המלא ב־Hugging Face ↗