GPT
F

Fun-CosyVoice3-0.5B-2512

קוד פתוח

FunAudioLLMapache-2.02025-12-11

  • onnx
  • safetensors
  • text-to-speech
  • zh
  • en

המודל מציע שכפול קול והקראת טקסט רב-לשונית עם השהיה של 150 מילי-שניות. הוא מתאים למי שחייב הזרמת אודיו דו-כיוונית בזמן אמת בלי להחזיק שרתים מפלצתיים.

  • 9.1 GBמשקל הקבצים
  • 117,095הורדות בחודש
  • 635לייקים

מה זה

מדובר במודל טקסט לקול בגודל 0.5B פרמטרים שמיועד לסינתזה ושכפול קול מאופס דגימות בכמה שפות, כולל אנגלית, סינית, צרפתית, ספרדית, יפנית, קוריאנית, גרמנית, איטלקית ורוסית. הוא תומך בהזרמת טקסט נכנס והזרמת אודיו יוצא במקביל, כולל שליטה בהוראות של רגש, קצב ודיאלקטים, ומשלב תיקון הגייה מבוסס פונמות ופונטיקה ללא צורך במודול עיבוד טקסט מסורתי.

במבחני המדידה, גרסת הבסיס מגיעה לשיעור שגיאות מילים של 2.24% באנגלית ודמיון דובר של 71.8%, לעומת שיעור שגיאות של 1.21% בסינית עם דמיון של 78.0%. קיימת גם גרסת RL שמורידה את אחוז השגיאות באנגלית ל־1.68% ובסינית ל־0.81%, תוך שמירה על דמיון קול שמתחרה במודלים קנייניים ומודלים פתוחים ששוקלים פי שלושה ממנו.

מתאים ל

  • בוטים קוליים בזמן אמת

    זמן תגובה של 150 מילי-שניות והזרמה דו-כיוונית מאפשרים מענה קולי מהיר בשיחות טלפון ובממשקים אינטראקטיביים.

  • שכפול קול חוצה שפות

    יכולת זירו-שוט מאפשרת לקחת דגימת קול קצרה בשפה אחת ולייצר דיבור באנגלית, צרפתית או שפות אחרות.

  • הקראת מספרים ומונחים טכניים

    המערכת תומכת בתיקון פונמות ונרמול מובנה של סמלים ומספרים ללא צורך במעטפת עיבוד חיצונית.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא היעדר מוחלט של תמיכה בעברית, כך שהוא לא יעזור למוצרים שמיועדים לשוק המקומי אלא רק למערכות באנגלית או בשפות הנתמכות האחרות. מעבר לכך, במבחני קצה קשים כמו מבחן test-hard שיעור השגיאות קופץ ל־6.71% בגרסת הבסיס ול־5.44% בגרסת ה־RL, נתון שמראה שבתנאי שפה מורכבים הוא עדיין מפספס מילים ודורש בדיקה מעמיקה לפני חיבור לפרודקשן.

שאלות
נפוצות

האם המודל תומך ביצירת דיבור בעברית?

לא. רשימת השפות הנתמכות כוללת סינית, אנגלית, יפנית, קוריאנית, גרמנית, ספרדית, צרפתית, איטלקית ורוסית בלבד. טקסט בעברית לא יעבוד כאן.

באיזו גרסה כדאי לבחור מבין השתיים שפורסמו?

עדיף לבחור בגרסת ה־RL אם הדיוק הוא השיקול המוביל. היא מציגה שיעור שגיאות נמוך יותר של 1.68% באנגלית לעומת 2.24% בגרסת הבסיס, ושיפור דומה בטקסטים מורכבים.

איך מריצים

ההתקנה דורשת סביבת לינוקס עם פייתון 3.10, חבילות מערכת כמו sox, והורדה של משקל הקבצים שמסתכם ב־9.1 ג'יגה-בייט עבור המשקלים ועזרי הטקסט. בזכות גודל של חצי מיליארד פרמטרים, אפשר להריץ אותו מקומית על כרטיס מסך בודד עם זיכרון צנוע, ויש תמיכה ב־vLLM, Triton ו־TRT-LLM למיטוב ביצועים בהפקה.

אם אתם לא צריכים שיהוק השהיה של 150 מילי-שניות או שכפול קול מותאם אישית מאחורי חומת אש, ההתעסקות בהגדרת סביבת התלויות והמודולים המשלימים לנרמול טקסט עלולה להיות מיותרת מול API מוכן.

pip install -U huggingface_hub
hf download FunAudioLLM/Fun-CosyVoice3-0.5B-2512

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המודל בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗