GPT
S

Spark-TTS-0.5B

קוד פתוח

SparkAudiocc-by-nc-sa-4.02025-02-27

  • safetensors
  • text-to-speech
  • en
  • zh

הפיכת טקסט לדיבור שמבוססת ישירות על מודל שפה קטן, ללא מודלי פעפוע נפרדים ברקע. אתם מקבלים שכפול קול מהיר באנגלית ובסינית בלבד, עם שליטה מלאה בגובה הצליל ובקצב.

  • 3.7 GBמשקל הקבצים
  • 929הורדות בחודש
  • 747לייקים

מה זה

המודל נשען כולו על ארכיטקטורת Qwen2.5 כדי להמיר טקסט ישירות לייצוגי שמע, בלי להזדקק לשלבים מורכבים כמו flow matching שמאטים את התהליך. הוא מייצר שמע ישירות מתוך הטוקנים שהמודל חוזה, מה שהופך את כל הצינור לפשוט ומהיר יותר בהשוואה למערכות שמפצלות את העבודה בין כמה מודלים כבדים.

הוא מתמקד ביצירת קולות וירטואליים לפי פרמטרים של מגדר, גובה צליל ומהירות דיבור, לצד שכפול קול של דוברים חדשים בדגימה אחת. התמיכה מתרכזת במעבר שוטף בין אנגלית לסינית, כולל ערבוב שפות באותו משפט, אך ללא שום תמיכה בשפות אחרות.

מתאים ל

  • יצירת קריינות באנגלית

    התאמת גובה הצליל וקצב הדיבור לייצור קולות שונים לפודקאסטים או הדגמות, ללא עלויות ריצה כבדות.

  • שכפול קול למחקר

    בדיקת יכולות חיקוי קול מדגימה קצרה באנגלית ובסינית לצורכי מחקר אקדמי ופיתוח פנימי בלבד.

  • דיבוב מעורב אנגלית וסינית

    הפקת דיבור שמשלב שתי שפות ברצף בלי לשבור את אופי הקול של הדובר.

איפה זה נופל

החיסרון הברור ביותר לישראלים הוא היעדר מוחלט של עברית, המודל מוגבל אך ורק לאנגלית ולסינית. מעבר לכך, המפתחים עדיין לא שחררו את קוד האימון ואת מערך הנתונים שעליו הוא אומן, כך שאי אפשר לאמן אותו מחדש על שפות נוספות באופן עצמאי. שכפול קול בדגימה בודדת עלול לייצר חוסר יציבות באיכות אם דגימת המקור רועשת, ויש לוודא היטב את תקינות ההגייה של מושגים טכניים לפני שסומכים עליו.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בעברית?

לא, המודל אומן אך ורק על אנגלית וסינית. טקסט בעברית פשוט לא ייקרא נכון או יפיק שגיאות, ומכיוון שקוד האימון המלא לא שוחרר כרגע, אי אפשר ללמד אותו עברית בקלות.

אפשר להטמיע אותו במוצר מסחרי של החברה שלי?

בשום אופן לא. המודל מוגן תחת רישיון לא מסחרי עקב מגבלות של נתוני האימון שלו. כל שימוש עסקי או מכירה של תוצרים ממנו מפרים את תנאי השימוש ישירות.

איזה כרטיס מסך צריך כדי לייצר שמע?

מדובר במודל של 0.5B פרמטרים בלבד שמשקלו 3.7 ג'יגה בייט. כרטיס מסך ביתי סטנדרטי עם 8 ג'יגה בייט זיכרון ייעודי יריץ אותו בצורה חלקה וללא קושי.

איך מריצים

כדי להריץ אותו צריך סביבת Python 3.12, התקנת הדרישות מהמאגר בגיטהאב והורדת משקלי המודל שתופסים 3.7 ג'יגה בייט. ההרצה מתבצעת ישירות בסקריפט פייתון או דרך ממשק דפדפן מקומי, שבו מעלים דגימת קול או מקליטים ישירות דרך המיקרופון.

בזכות גודל של חצי מיליארד פרמטרים, המודל רץ בנוחות על כרטיס מסך ביתי בודד עם זיכרון צנוע של 6 עד 8 ג'יגה בייט. אין כאן מגוון גרסאות גודל שונות לבחור ביניהן, כך שאם יש לכם כרטיס תואם עם תמיכת קודה אין שום סיבה לשלם על שירות ענן חיצוני.

pip install -U huggingface_hub
hf download SparkAudio/Spark-TTS-0.5B

הרישיון

הרישיון הוא CC-BY-NC-SA 4.0, מה שאומר שאסור להשתמש בו לשום מטרה מסחרית או להטמיע אותו במוצר שמייצר הכנסות. המפתחים שינו את הרישיון במקור מרישיון חופשי עקב תנאי הדאטה שעליו אומן. כל פיתוח נגזר או שינוי מחייב הפצה תחת אותו הרישיון המדויק ומתן קרדיט מלא.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗