GPT
V

vagdhenu

קוד פתוח

prathoshapapache-2.02026-06-28

  • f5-tts
  • sanskrit
  • chant
  • text-to-speech
  • indicf5

מודל המרת טקסט לדיבור ייעודי לדקלום ושירה בסנסקריט קלאסית. הוא מתאים למי שחייב הגייה מדויקת של עיצורים מורכבים שלא נשברים כמו במודלים כלליים להודית.

  • 2.9 GBמשקל הקבצים
  • 3,299הורדות בחודש
  • 53לייקים

מה זה

מדובר במודל מבוסס F5 ודיפוזיה עם כ־337 מיליון פרמטרים, שאומן על כחמש שעות הקלטה של דובר יחיד. הוא בנוי על IndicF5 ומיועד ספציפית לדקלום מסורתי. ציון ה־MOS שלו מגיע ל־4.6 בקרב מאזינים מומחים, ועל פי הבדיקות הוא מפיק מאה אחוז דיוק בחיבורי עיצורים מורכבים, כולל עיצורים כפופים מנושפים שבדרך כלל קורסים במודלים רחבים.

השוני המרכזי כאן הוא בפתרון לבעיית המחיקה של תנועת השווא שקיימת בהינדי. כדי לעקוף את זה, הטקסט מנותב דרך כתב קאנדה. בנוסף, הוא משתמש בווקודר BigVGAN-v2 שעבר התאמה מיוחדת, כי הווקודר המקורי יצר רעידות בתנועות ארוכות.

מתאים ל

  • לימוד דקלום סנסקריט

    הקראה מדויקת של שירה קלאסית עם שמירה על משקלים פואטיים ועיצורים מורכבים.

  • הנגשת כתבים עתיקים

    המרת שורות מכתבי קודש ומזמורים לקובצי אודיו בקול ברור למי שמתקשה בקריאה.

  • הפקת תוכן קולי מסורתי

    הפקת שמע לפרויקטים מחקריים ותרבותיים הזקוקים להגייה נקייה מתופעות בליעת שווא.

איפה זה נופל

הוא לא יודע לקרוא טקסטים וודיים עם טעמים עתיקים, כי אין לו תמיכה בטעמי ודה. אין לו ראשים ייעודיים לגובה צליל או משך, מה שאומר שהפרוזודיה נשענת לגמרי על קובץ ייחוס שחייב להתאים בדיוק לטקסט הנקרא ולא ניתנת לעיצוב חופשי. בנוסף, הקול מבוסס על דובר יחיד, כך שאין שום גיוון קולי, ושימוש במודל לטקסט רגיל שאינו שירה סנסקריטית פשוט ייתן תוצאה לא מתאימה.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסטים מודרניים בהינדי או שפות הודיות אחרות?

לא. המודל עבר התאמה ייעודית של חמש שעות לדקלום סנסקריט קלאסי בלבד. ניסיון להזין שפות אחרות או שיח יומיומי יניב דקלום מלאכותי במקרה הטוב ושיבושי הגייה במקרה הרע.

למה צריך קובץ ייחוס בשביל לייצר אודיו?

בארכיטקטורה של F5 אין רכיב נפרד לקביעת קצב ואינטונציה. המודל שואב את סגנון הדיבור, הקצב וגובה הצליל ישירות מקליפ ייחוס קצר, שחייב לחפוף מילה במילה לקטע הדיבור שמוגדר לו.

איך מריצים

המודל כולו שוקל 2.9 גיגה בייט ומבוסס על קוד בריפו בגיטהאב. מריצים סקריפט התקנה שמוריד את המשקולות, ואז קוראים לקובץ רנדר עם הטקסט והמשקל השירי. למשקולות בגודל 337 מיליון פרמטרים ואינפרנס מבוסס דיפוזיה מספיק כרטיס מסך ביתי מודרני עם זיכרון צנוע, ואין צורך בשרתי ענק.

יש שני קובצי קול לבחירה: גרסת הייצור המומלצת שכוללת ניתוב קולי, וגרסת גיבוי שמושפעת ישירות מדגימת הייחוס. מכיוון שמדובר בכלי ממוקד בלי נקודת קצה מסחרית מנוהלת, אין כאן אופציה ל־API חיצוני מוכן, ותצטרכו לארח ולהריץ אותו בעצמכם על שרת ייעודי.

pip install -U huggingface_hub
hf download prathoshap/vagdhenu

הקבצים

7 קבצים במאגר, 2.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפיתוח עצמו משוחרר ברישיון Apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. יש לשים לב שהווקודר נגזר מ־BigVGAN-v2 של NVIDIA, ומחייב ציות לתנאי הרישיון שלהם, בעוד שבסיס ה־IndicF5 ברישיון MIT.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗