GPT
O

OuteTTS-0.1-350M

קוד פתוח

OuteAIcc-by-4.02024-11-03

  • safetensors
  • llama
  • text-to-speech
  • en

מודל קול פצפון שמייצר דיבור באנגלית מבוסס LLaMa בלי מודולים מורכבים מסביב. מתאים למי שרוצה להריץ שכפול קול מקומי על מחשב רגיל בלי להסתבך עם ספריות אודיו כבדות.

  • 362Mפרמטרים
  • 4,096טוקנים בהקשר
  • 698 MBמשקל הקבצים
  • 138הורדות בחודש

מה זה

במקום לתפור רשת נפרדת לטקסט ורשת נפרדת לאודיו, OuteAI לקחו ארכיטקטורת LLaMa של 362 מיליון פרמטרים ואימנו אותה לחזות טוקנים של קול בדיוק כמו שהיא חוזה מילים. תהליך העבודה מפרק את האודיו לטוקנים דרך WavTokenizer בקצב של 75 טוקנים לשנייה, נעזר ביישור מילים בשיטת CTC forced alignment, ומייצר דיבור ישירות מתוך הפרומפט.

הגישה הזו נותנת לכם יכולת לשכפל קול מקובץ שמע קצר וטקסט תואם, תוך שימוש במודל ששוקל 698 מגה בייט בלבד. הבסיס נשען על נתוני LibriTTS-R ו־MLS, כשהאימון ממוקד באנגלית בלבד. זה ניסוי מעניין שמוכיח שרשת שפה רגילה לחלוטין מסוגלת לדבר, אם כי בגודל הזה היא עדיין מועדת לשגיאות בסיסיות בהגייה וברצף.

מתאים ל

  • ניסויי שכפול קול מקומיים

    מאפשר לבדוק שכפול קול מקובץ שמע בסיסי ישירות על המחשב, בלי לשלוח מידע לשרת חיצוני.

  • הקראת משפטים קצרים באופליין

    מתאים למערכות פשוטות שצריכות להשמיע חיווי קולי קצר באנגלית על חומרה חלשה בלי רשת.

  • מחקר על מודלי שפה לאודיו

    פלטפורמה נוחה וקלה לבחינת ארכיטקטורת LLaMa שמייצרת טוקנים קוליים ישירות מפרומפט טקסטואלי.

איפה זה נופל

היוצרים מצהירים בגלוי שמדובר בגרסת ניסוי ראשונית 0.1, והגודל הזעיר גובה מחיר כבד. המודל נוטה להשמיט מילים, להכניס מילים שלא היו בטקסט, או לעוות אותן לחלוטין. הוא תומך במחרוזות בלבד, מתקשה עם משפטים ארוכים, ורגיש מאוד להגדרת הטמפרטורה. בדוגמאות שלהם רואים שטמפרטורה של 0.1 גרמה לו להיכשל במעקב אחרי הטקסט, ורק העלאה ל־0.7 ייצבה את הדיבור. נוסף לכך, אין שום תמיכה בעברית.

אותה משפחה

OuteTTS-0.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מדבר עברית?

לא. המודל אומן על מאגרי LibriTTS-R ו־MLS באנגלית בלבד. אם תזינו לו טקסט בעברית הוא ייכשל או ייצר צלילים משובשים.

אפשר להריץ אותו על המעבד בלי כרטיס מסך?

כן. הקבצים שוקלים פחות מ־700 מגה בייט וקיימת תמיכה ב־GGUF, כך שמעבד מודרני מריץ אותו בלי מאמץ מיוחד דרך llama.cpp.

איך מריצים

כדי להריץ אותו מתקינים את החבילה outetts וטוענים את המודל דרך פייתון עם ממשק Hugging Face או בגרסת GGUF דרך llama.cpp. בגלל הגודל הקומפקטי שלו, הוא לא דורש כרטיס גרפי יקר ומסוגל לרוץ ישירות על מעבד רגיל של מחשב נייד או מאיץ בסיסי מאוד בלי לתפוס זיכרון עבודה.

מי שרוצה לשלב דיבור אמין במוצר חי יעדיף לשלם ל־API חיצוני כמו ElevenLabs. המודל הזה מתאים כרגע לפיתוח מקומי, בדיקות רעיון, או פרויקטים אישיים שחייבים לפעול אופליין ובלי עלויות שוטפות.

pip install -U huggingface_hub
hf download OuteAI/OuteTTS-0.1-350M

הרישיון

הפרויקט מופץ ברישיון cc-by-4.0. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, ולשלב אותו בקוד סגור, כל עוד נותנים קרדיט ברור ליוצרים. המפתחים מסירים כל אחריות לתקלות או נזקים שייגרמו מהשימוש.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗