GPT
F

fish-speech-1.2

קוד פתוח

fishaudiocc-by-nc-sa-4.02024-07-02

  • transformers
  • dual_ar
  • text-to-speech
  • en
  • zh

מודל המרת טקסט לדיבור במשקל קל של 1.1 ג'יגה־בייט בלבד. הוא מאומן על 300 אלף שעות שמע ומיועד למי שמחפש פתרון קומפקטי לאנגלית, סינית ויפנית.

  • 4,096טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 121הורדות בחודש
  • 210לייקים

מה זה

מדובר במודל text-to-speech קומפקטי שנשען על מאגר עצום של 300,000 שעות שמע. בנפח של 1.1 גיגה בלבד, הוא מציע פתרון שאינו דורש תשתית כבדה כדי לייצר קולות טבעיים, כל עוד מדובר באחת משלוש השפות שהוא מכיר: אנגלית, סינית או יפנית.

הוא בנוי לעבודה עם ספריית transformers וכולל חלון הקשר של 4,096 טוקנים, מה שמאפשר לו לקבל קטעי טקסט ארוכים ברצף בלי לחתוך אותם לפילוחים קטנים מדי. היוצרים שלו לא פרסמו מדדי איכות מספריים בכרטיס המודל, אלא מפנים לדמו ישיר ברשת ולמאגר הקוד שלהם כדי להתרשם מהביצועים.

מתאים ל

  • פיתוח כלי למידה לאסיה

    אימון על סינית ויפנית בהיקף של 300k שעות מספק הגייה טובה לתרגול שפות.

  • הקראת טקסטים ארוכים

    חלון הקשר של 4,096 טוקנים מאפשר להקריא מאמרים באנגלית ברצף ללא חיתוך.

  • ניסויי שמע מקומיים

    משקל של 1.1 גיגה רץ בקלות על חומרה אישית למחקר ובדיקות שאינן למטרות רווח.

איפה זה נופל

הבעיה המרכזית שלו למפתח ישראלי היא היעדר מוחלט של תמיכה בעברית. המודל מאומן אך ורק על אנגלית, סינית ויפנית, ולכן כל ניסיון להזין לו טקסט מקומי פשוט לא יעבוד. מעבר לזה, כרטיס המודל כמעט ולא חושף מגבלות טכניות, ארטיפקטים קוליים אופייניים או מדדי שגיאה. תצטרכו לבדוק בעצמכם את איכות ההגייה, יציבות הקול וההתמודדות עם שמות משובשים לפני שאתם בונים עליו למשהו רציני.

שאלות
נפוצות

האם המודל תומך בהקראת עברית?

לא. הוא אומן באופן בלעדי על אנגלית, סינית ויפנית, ולא יפיק תוצאה שמישה עם טקסט בעברית.

אפשר להטמיע אותו באפליקציה מסחרית?

לא באופן ישיר. הרישיון של המשקלים הוא לא־מסחרי בלבד, ולכן שימוש כזה יפר את תנאי היוצרים.

איך מריצים

במשקל של 1.1 גיגה בערך, תוכלו להריץ אותו בקלות על כרטיס מסך ביתי מודרני ואפילו על מחשבים ניידים עם GPU בסיסי. העבודה דרך transformers הופכת את השילוב בקוד לפשוט למדי.

אם אתם לא רוצים להחזיק שרתים דולקים באופן רצוף או להתעסק בתחזוקה מקומית, באתר של fish audio יש הדגמה וחלופות מוכנות, אבל בהתחשב בגודל הקטן שלו, הרצה עצמית מקומית היא לגמרי בהישג יד ואינה מייצרת עלויות מחשוב כבדות.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="fishaudio/fish-speech-1.2")
print(pipe("שלום"))

הרישיון

המשקלים משוחררים תחת רישיון cc-by-nc-sa-4.0, שמשמעותו איסור מוחלט על שימוש מסחרי, חובת מתן קרדיט, וחובת שיתוף זהה לכל נגזרת. אם אתם בונים מוצר בתשלום או רוצים לשלב אותו באפליקציה עסקית, אתם לא יכולים להשתמש בו. קוד המקור בגיטהאב שוחרר תחת BSD-3-Clause, אך משקלי המודל עצמם סגורים לשימוש מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗