GPT
F

F5-TTS

קוד פתוח

SWividcc-by-nc-4.02024-10-07

  • f5-tts
  • text-to-speech

הפיכת טקסט לדיבור שמבוססת על Flow Matching ומספקת שיבוט קול מהיר. פתרון מתאים למי שרוצה להפיק דיבור רציף בהרצה מקומית בלי תלות בשירותי ענן יקרים.

  • 6.3 GBמשקל הקבצים
  • 883,613הורדות בחודש
  • 1,200לייקים

מה זה

מדובר במודל שמייצר דיבור ומבצע שיבוט קול מתוך דגימת אודיו קצרה, תוך שימוש בארכיטקטורה של Flow Matching במקום מודלי דיפוזיה מסורתיים או גישות מבוססות טוקנים. השיטה הזו מאפשרת לו להפיק קול שנשמע טבעי וזורם במהירות יצירה גבוהה יחסית, כפי שמוסבר במאמר האקדמי שפורסם איתו.

הוא מגיע לצד גרסאות נוספות כמו E2 TTS, וכולל משקלים מנקודות אימון שונות של המודל הבסיסי. החוזק שלו נמדד בדיוק של חיקוי גוון הקול וקצב הדיבור של הדובר המקורי, מה שהופך אותו לבחירה פופולרית מאוד בקהילת הקוד הפתוח עם מאות אלפי הורדות.

מתאים ל

  • מחקר אקדמי בקול

    בדיקת ביצועים של Flow Matching מול טכנולוגיות ישנות יותר על בסיס קוד פתוח.

  • יצירת תוכן אישי

    דיבוב סרטונים ביתיים או פודקאסטים אישיים ללא כוונת רווח באמצעות דגימת קול בודדת.

  • פיתוח כלי נגישות ניסיוניים

    הקראת טקסטים בהתאמה אישית לפרויקטים פנימיים שלא נמכרים למשתמשי קצה.

איפה זה נופל

הכרטיס מציג רק קישורים לקוד ולמאמר בלי פירוט של שפות נתמכות, כך שאין שום הבטחה לתמיכה בעברית ומודלים מסוג זה לרוב מתקשים בשפות ללא אימון מפורש. חסרים נתונים על התנהגות מול שמות פרטיים, רעשי רקע או יכולת שליטה באינטונציה מדויקת. תצטרכו לבדוק בעצמכם האם הדיקציה נשארת אמינה בטקסטים ארוכים.

שאלות
נפוצות

האם אפשר להשתמש במודל בתוך אפליקציה בתשלום?

לא. הרישיון אוסר לחלוטין כל שימוש מסחרי מכל סוג שהוא. אם אתם בונים מוצר למכירה, תצטרכו לחפש אלטרנטיבה ברישיון חופשי יותר.

באיזה קובץ משקלים כדאי לבחור מתוך התיקייה?

הגרסה המומלצת להתחלה היא F5TTS_v1_Base עם הקובץ המתקדם ביותר. היא מייצגת שלב אימון מאוחר יותר של המודל בהשוואה לגרסאות האחרות ברשימה.

איך מריצים

כדי להריץ אותו צריך להוריד את קובצי ה־safetensors ששוקלים כ־6.3 גיגהבייט ולשים אותם בתיקיית הבדיקה המתאימה, יחד עם התקנת הספרייה f5-tts. מומלץ להשתמש בגרסת model_1250000 שהיא המעודכנת ביותר מבין קובצי הבסיס שפורסמו.

הגודל הזה דורש כרטיס מסך מודרני עם לפחות שמונה עד שנים עשר גיגהבייט זיכרון גרפי כדי לייצר אודיו בזמן אמת. אם אין לכם חומרה כזו זמינה מקומית, עדיף להשתמש בשרת ייעודי מרוחק או בממשק חיצוני מוכן.

pip install -U huggingface_hub
hf download SWivid/F5-TTS

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שאסור להשתמש בו לכל מטרה מסחרית. מותר להריץ אותו, לחקור את הקוד, לשתף ולשנות רק בפרויקטים אישיים או מחקריים, ותמיד חובה לתת קרדיט ליוצרים המקוריים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗