GPT
C

CosyVoice2-0.5B

קוד פתוח

FunAudioLLMapache-2.02025-07-29

  • onnx
  • safetensors
  • text-to-speech
  • zh
  • en

מודל דיבור פתוח וקומפקטי שמיועד להמרת טקסט לקול ולשכפול קולות. הוא מביא תמיכה בהזרמה מהירה ובכמה שפות, בלי לדרוש שרתים מנופחים.

  • 4.5 GBמשקל הקבצים
  • 4,228הורדות בחודש
  • 91לייקים

מה זה

זהו מודל דיבור מבוסס ארכיטקטורת שפה שמייצר אודיו מטקסט ויודע לשכפל דוברים בהינתן דגימת קול קצרה. המודל שולט בשמונה שפות רשמיות כולל אנגלית, סינית, צרפתית, ספרדית, יפנית, קוריאנית, איטלקית ורוסית. מעבר להקראה רגילה, הוא תומך בהזרמת טקסט נכנס והזרמת אודיו יוצא במקביל, כולל יכולת עבודה עם תוספי נורמליזציה שונים של טקסט.

במדדי הטבלה באנגלית, הוא מציג שגיאת מילים של 2.57 אחוזים ודמיון דובר של 65.9 אחוזים, מספרים שמציבים אותו קצת מאחורי מודלים מתחרים בגודל דומה. לעומת זאת, במבחני סינית מאתגרים הוא מגיע לשגיאה של 6.83 אחוזים עם דמיון של 72.4 אחוזים, תוצאה שמנצחת מודלים פתוחים מקבילים כמו F5-TTS או אפילו מודלים סגורים כמו Seed-TTS באותו מבחן ספציפי.

מתאים ל

  • עוזרי קול באנגלית או סינית

    תמיכה בהזרמת קלט ופלט מאפשרת לייצר מענה קולי מהיר בתוך שירותי שיחה.

  • שכפול קול מקומי לחומרה צנועה

    המשקל הנמוך של הקבצים מאפשר להריץ אותו ישירות על כרטיס מסך בודד בלי תלות ברשת.

  • קריינות במספר שפות נתמכות

    יכולת העבודה עם שמונה שפות זרות מתאימה לתרגום והקראת תוכן גלובלי.

איפה זה נופל

החיסרון המרכזי למשתמש בארץ ברור מיד: אין שום תמיכה בעברית ברשימת השפות, כך שהוא פשוט לא רלוונטי לטקסט מקומי. בנוסף, ביצועי ההקראה באנגלית פחות טובים מרוב המתחרים הפתוחים שנבדקו, עם שיעור שגיאות גבוה יותר ודמיון דובר שנמצא בתחתית הטבלה. התיעוד הרשמי גם מציין במפורש שהתוכן מיועד למטרות אקדמיות בלבד, כך שיציבות המערכת בקצה דורשת בדיקות קפדניות שלכם.

שאלות
נפוצות

האם המודל תומך בהקראת טקסט בעברית?

לא. המודל אומן ותומך בשמונה שפות ספציפיות בלבד, בהן אנגלית, סינית, ספרדית, צרפתית ורוסית. אין בו תמיכה באותיות עבריות או בניקוד.

איזה כרטיס מסך צריך כדי להריץ אותו?

קבצי המודל שוקלים 4.5 גיגה. כרטיס מסך עם שמונה גיגה זיכרון יריץ אותו בקלות, ויש גם תמיכה ב־vLLM להאצת תהליך יצירת האודיו.

איך המודל מתמודד עם מספרים וסימנים בטקסט?

הוא מגיע עם מנגנון נורמליזציה מובנה דרך ספריית WeTextProcessing. אפשר גם להתקין חבילה נוספת בשם ttsfrd לשיפור הקריאה של תווים מיוחדים.

איך מריצים

כדי להריץ אותו צריך סביבת פייתון 3.10, התקנת ספריות קול ברמת מערכת ההפעלה כמו sox, והורדה של כארבעה וחצי גיגה של משקלים. יש אפשרות להוסיף חבילה בשם ttsfrd לנורמליזציה טובה יותר של טקסט, אבל המערכת תעבוד עם WeTextProcessing כברירת מחדל אם תוותרו עליה. הפרויקט כולל שרת מובנה מבוסס FastAPI, תמיכה בהאצה עם vLLM, ואפילו תמיכה ב־Triton ו־TensorRT-LLM לסביבות שדורשות ביצועים גבוהים.

בזכות הגודל הצנוע, כרטיס מסך ביתי מודרני עם שמונה גיגה של זיכרון יספיק לטעינה ולהסקה שוטפת. אם אתם צריכים רק קריאה מזדמנת בלי תחזוקת תשתיות, שירות ענן חיצוני יחסוך את כאב הראש של תלויות הקוד וההרצה העצמאית.

pip install -U huggingface_hub
hf download FunAudioLLM/CosyVoice2-0.5B

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי. יחד עם זאת, בכרטיס המודל מופיעה הבהרה שהפרויקט נועד למטרות אקדמיות בלבד, סתירה שמומלץ לבדוק משפטית לפני שילוב שלו במוצר מסחרי פעיל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗