GPT
F

F5-TTS-pt-br

קוד פתוח

firstpixelcc-by-nc-4.02025-01-28

  • f5-tts
  • portuguese
  • pt-br
  • pt
  • tts

התאמה ייעודית של ארכיטקטורת F5 לפורטוגזית ברזילאית. מי שמחפש סינתזת קול עם שיבוט לפי דגימת רפרנס קצרה ושליטה ברגשות בשפה הזו ימצא כאן נקודת פתיחה טובה.

  • 11.3 GBמשקל הקבצים
  • 2,034הורדות בחודש
  • 75לייקים

מה זה

מדובר במשקולות אומנו עבור פורטוגזית ברזילאית בלבד, על בסיס הטוקנייזר של מודל המקור. האימון נשען על שילוב מאגרים כמו Common Voice של מוזילה ופייסבוק, עם מעל 3,500 דוברים וסך של כ־90 אלף דגימות באורך ממוצע של 17.73 שניות. התוצאה מכוונת לספק שיבוט קול שנשמע טבעי ומחקה את גוון הדובר לפי הקלטת מקור.

הקוד הנלווה כולל מעטפת פייתון בשם AgentF5TTS שמנהלת את התהליך. היא מאפשרת להזין קובץ טקסט עם תגיות רגש ודובר, להצמיד להן קבצי קול שונים ברקע, ולחבר אוטומטית את כל חלקי האודיו לקובץ סופי בעזרת FFmpeg. זה פותר חלק ניכר מהעבודה השחורה שנדרשת בדרך כלל בהרכבת משפטים שלמים.

מתאים ל

  • דיבוב סרטוני הדרכה בפורטוגזית

    מאפשר לשבט קול של מדריך יחיד ולהפיק דיבוב מקומי לפי קובצי טקסט מחולקים.

  • יצירת דמויות למשחקים עצמאיים

    המעטפת תומכת בהחלפת רגשות ודוברים ישירות מתוך התסריט לצורך פרויקטים ללא כוונת רווח.

  • הקראת תוכן כתוב למחקר

    מתאים להמרת טקסטים ארוכים לאודיו בפורטוגזית ברזילאית במסגרת ניסויי מעבדה אקדמיים.

איפה זה נופל

היוצר מגדיר את המשקולות כבדיקה ראשונית בלבד, והוא מדבר אך ורק פורטוגזית. הוא רגיש מאוד לקלט: חייבים להמיר מספרים למילים כתובות בעזרת num2words, להקפיד על אותיות קטנות בלבד, ולשמור על שורות טקסט קצרות כדי שהוא לא יאבד כיוון. בנוסף, חובה לספק הקלטות ייחוס קצרות מאוד של חמש עד תשע שניות, אחרת איכות השיבוט והקול מתפרקות בקלות.

שאלות
נפוצות

האם אפשר להשתמש בו להפקת דיבור בעברית או באנגלית?

לא. המודל אומן ספציפית על דאטה בפורטוגזית ברזילאית, והמפתח מצהיר במפורש שהוא מיועד לשפה הזו בלבד. ניסיון להזין לו טקסט בשפות אחרות לא יניב תוצאה שימושית.

מה נדרש להכין מראש לפני ששולחים טקסט להקראה?

חובה לעבד את הטקסט כך שכל המספרים ייכתבו במילים מלאות, להפוך הכל לאותיות קטנות ולחלק למשפטים קצרים. בנוסף, צריך להכין קטעי אודיו קצרים של הדובר באורך 5 עד 9 שניות שישמשו כדגימת ייחוס.

איך מריצים

צריך להוריד קבצים בנפח של 11.3 גיגה בייט ולהתקין את f5-tts, safetensors, torch ו־ffmpeg. המודל נבדק ואומן על חומרה כבדה שכללה כרטיסי A100 וזוג כרטיסי RTX 3090 עם 48 גיגה בייט זיכרון במקביל. כדי להריץ אותו אצלכם בקצב סביר תצטרכו כרטיס מסך ייעודי של Nvidia עם זיכרון גרפי מרווח, אם כי הקוד תומך גם ב־mps של אפל.

אם אין לכם שרת עם מעבד גרפי מתאים ואתם צריכים תפוקה יציבה בזמן אמת, הרצה עצמאית כזו תהיה יקרה וכבדה מדי בהשוואה לשירותי ענן מוכנים שגובים לפי שבריר שנייה של דיבור.

pip install -U huggingface_hub
hf download firstpixel/F5-TTS-pt-br

הקבצים

6 קבצים במאגר, 11.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0 בגלל תנאי השימוש של פרויקט F5-TTS המקורי. המשמעות פשוטה: מותר להשתמש בו למחקר, ניסויים ופיתוח פנימי בלבד. אסור לשלב אותו בשום מוצר מסחרי, שירות בתשלום או פעילות עסקית שמניבה הכנסה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗