GPT
P

parler-tts-mini-multilingual-v1.1

קוד פתוח

parler-ttsapache-2.02024-11-22

  • transformers
  • safetensors
  • parler_tts
  • text-generation
  • text-to-speech

מודל הקראת טקסט רב לשוני שמאפשר לשלוט באופי הקול, במהירות ובאיכות ההקלטה באמצעות תיאור טקסטואלי חופשי. הוא כולל 16 דוברים קבועים ומתאים למי שמחפש פתרון קוד פתוח עצמאי לשמונה שפות אירופיות.

  • 938Mפרמטרים
  • 3.5 GBמשקל הקבצים
  • 33,648הורדות בחודש
  • 58לייקים

מה זה

המודל מבוסס על הארכיטקטורה של ParlerTTS וכולל 938 מיליון פרמטרים. הוא מאומן על כ־9,200 שעות של דיבור שאינו אנגלית מתוך מאגרי CML-TTS ו־Multilingual LibriSpeech, יחד עם עוד 580 שעות של אנגלית באיכות גבוהה. השפות הנתמכות כוללות אנגלית, צרפתית, ספרדית, פורטוגזית, פולנית, גרמנית, איטלקית והולנדית.

בניגוד למודלי TTS רגילים שמקבלים רק מזהה דובר קשיח, כאן משתמשים בשני טוקנייזרים נפרדים, אחד לטקסט המוקרא ואחד לתיאור הקול. אתם מתארים במילים מאפיינים כמו מגדר, מהירות, גובה קול, הד ורמת רעש ברקע, והוא מייצר את האודיו בהתאם. גרסה 1.1 הוסיפה שמות דוברים עקביים כך שאפשר לקרוא לדמות ספציפית ולקבל את אותו גוון קול לאורך זמן.

מתאים ל

  • הקראת תוכן בשפות אירופיות

    הפקת פודקאסטים או קריינות לספרים בצרפתית, גרמנית או ספרדית, תוך שמירה על קול אחיד של אותו דובר לאורך פרקים שונים.

  • בניית מאגרי שמע סינתטיים

    יצירת דגימות אודיו עם שליטה מדויקת ברעשי רקע וסוגי מיקרופון כדי לאמן מודלים אחרים לזיהוי דיבור.

  • דיבוב מערכות במכשירים מבודדים

    הטמעת מנוע דיבור מלא באפליקציות מקומיות ללא צורך בחיבור לשרתים חיצוניים ובלי עלויות לפי שימוש.

איפה זה נופל

החיסרון המרכזי למפתחים בארץ ברור מיד: עברית לא נתמכת בכלל. רשימת השפות מוגבלת לשמונה שפות אירופיות בלבד. מעבר לזה, פיזור הדאטה בין הדוברים הקבועים אינו מאוזן. בעוד שדוברי ספרדית או הולנדית מסוימים אומנו על עשרות או מאות אלפי דוגמאות, ישנם דוברים ברשימה, כמו מייגן באיטלקית, עם 4 מופעים בלבד, מה שהופך אותם לחסרי תועלת מעשית. איכות התוצאה תלויה מאוד בניסוח מדויק של תיאור הקול ובשימוש במילות מפתח ספציפיות שהמודל מכיר.

שאלות
נפוצות

האם המודל תומך בהקראת עברית?

לא. המודל אומן רק על שמונה שפות אירופיות ספציפיות ואינו מכיל עברית. עם זאת, הטוקנייזר שלו כולל מנגנון byte fallback ומילון רחב, מה שמקל טכנית על מי שרוצה לקחת אותו ולאמן אותו על מאגר נתונים בעברית.

איך שומרים על אותו קול בין משפטים שונים?

משתמשים באחד מ־16 שמות הדוברים המובנים בתוך שורת התיאור, למשל לציין שזה הקול של Daniel או Nicole. כדאי לבחור דובר עם מספר הופעות גבוה בטבלה כדי לקבל תוצאה יציבה ועקבית.

מה נותן התיאור הטקסטואלי של הקול בפועל?

התיאור קובע את סגנון ההקראה. אפשר להגדיר אם רוצים קול נשי או גברי, קצב מהיר או איטי, הד של חדר, ואיכות הקלטה נקייה או רועשת באמצעות ביטויים ספציפיים שהוגדרו מראש.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.5 גיגה בייט בדיוק float32. בשביל להריץ אותו מקומית באופן סביר צריך כרטיס מסך עם לפחות 8 עד 12 גיגה בייט זיכרון גרפי, תלוי באופטימיזציות שתפעילו כמו SDPA או torch.compile. ההתקנה נעשית ישירות ממאגר הגיטהאב של parler-tts ומשתמשת בספריית transformers.

אם אתם צריכים זמני תגובה נמוכים מאוד לשיחה חיה או שאין לכם חומרה ייעודית בענן, פנייה לפתרונות API קיימים תהיה פשוטה בהרבה. הרצה עצמית שווה את המאמץ בעיקר אם חשוב לכם לשמור על פרטיות מלאה, לעבוד ללא תלות ברשת חיצונית, או לעשות התאמות ואימונים נוספים על הדאטה שלכם.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="parler-tts/parler-tts-mini-multilingual-v1.1")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗