GPT
O

OuteTTS-0.2-500M

קוד פתוח

OuteAIcc-by-nc-4.02024-11-24

  • safetensors
  • qwen2
  • text-to-speech
  • en
  • zh

מודל הקראת טקסט ושיבוט קול קומפקטי ששוקל פחות מגיגהבייט אחד. הוא מתאים למי שרוצה להריץ סינתזת דיבור מקומית בלי כרטיס מסך מפלצתי.

  • 499Mפרמטרים
  • 32,768טוקנים בהקשר
  • 969 MBמשקל הקבצים
  • 430הורדות בחודש

מה זה

מדובר במודל המרת טקסט לדיבור שנבנה על בסיס מודל השפה Qwen-2.5-0.5B. הרעיון כאן הוא שימוש בטוקנים של אודיו ישירות בארכיטקטורת שפה מוכרת, בלי לשנות את מבנה הבסיס שלה. הגרסה הזו אומנה על יותר מחמישה מיליארד טוקנים של אודיו, מה שנותן לה דיוק גבוה בהרבה במעקב אחרי הנחיות וזרימת דיבור טבעית ביחס לגרסה הראשונה.

המודל כולל יכולת שיבוט קול מקובץ שמע קצר ומגיע עם תמיכה מובנית בשפות אנגלית, סינית, יפנית וקוריאנית. השילוב בין גודל זעיר ליכולת לשמור ולטעון פרופילי קול בקובץ ג'ייסון פשוט הופך אותו לפתרון נגיש מאוד להרצה מקומית.

מתאים ל

  • עוזרים קוליים מקומיים

    הוא שוקל 969 מגהבייט בלבד ויכול לייצר דיבור באנגלית ישירות על המכשיר בלי חיבור לרשת.

  • שיבוט קול מהיר למשחקים

    יצירת פרופיל קול מקובץ של 10 שניות ושמירתו בקובץ טקסט פשוט מאפשרת להחליף דמויות בקלות.

  • קריינות אופליין למסמכים

    הקראת טקסטים באנגלית ללא תלות בספקי ענן חיצוניים ובעלויות שוטפות לפי דקת שמע.

איפה זה נופל

התמיכה בשפות שאינן אנגלית, כמו סינית, יפנית וקוריאנית, מוגדרת רשמית כניסיונית בלבד. עברית לא נתמכת כאן בכלל, כך שלטקסט מקומי הוא פשוט לא יעבוד. בנוסף, חלון היצירה בפועל מוגבל לכ־54 שניות של אודיו, וכאשר משתמשים בפרופיל שיבוט קול, הזמן הזה מתקצר עוד יותר בהתאם לאורך דגימת הקול שהוזנה.

המודל גם מתקשה לשכפל קולות עם מבטאים חריגים או מאפיינים שונים מאוד ממאגרי האימון שלו. במקרים כאלה תצטרכו להקליט דגימה נקייה מאוד מרעשים באורך של 10 עד 15 שניות עם תמלול מדויק, או לבצע כוונון עדין למודל בעצמכם.

אותה משפחה

OuteTTS-0.2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בהקראת טקסט בעברית?

לא. המודל תומך בעיקר באנגלית, ומכיל תמיכה ניסיונית בלבד בסינית, יפנית וקוריאנית. אין לו שום ידע בשפה העברית ולכן הוא אינו מתאים למוצרים הפונים לישראל.

כמה שמע אפשר לייצר ברצף אחד?

אורך היצירה המרבי של קטע שמע עומד על כ־54 שניות. אם אתם מוסיפים דגימת קול לצורך שיבוט, משך הזמן הכולל מתקצר ביחס ישיר לאורך הדגימה שהעליתם.

איך מריצים

המשקל הכולל יושב על פחות מגיגהבייט, כך שאפשר להריץ אותו כמעט על כל חומרה מודרנית. ההרצה נעשית דרך חבילת הפייתון ייעודית, ויש תמיכה ישירה בספריות Transformers, GGUF דרך מעבד רגיל, או ExLlamaV2 לביצועים מהירים על מעבדים גרפיים.

אם יש לכם מחשב נייד פשוט או שרת ענן בסיסי, הוא יעבוד בלי בעיה ולא ידרוש זיכרון וידאו יקר. במקרה שצריך אלפי שעות שמע בדקה אחת בקנה מידה עצום, כנראה שעדיף לשלם לשירות ענן מנוהל במקום להחזיק אשכול שרתים משלכם.

pip install -U huggingface_hub
hf download OuteAI/OuteTTS-0.2-500M

הרישיון

הרישיון הוא CC BY-NC 4.0. זה אומר שמותר להוריד, לשנות ולהריץ את המודל לצרכי מחקר, לימוד ובדיקות פנימיות, תוך מתן קרדיט ליוצרים. שימוש מסחרי מכל סוג אסור לחלוטין, כך שאי אפשר לשלב אותו במוצר שמייצר הכנסות או מוצע כשירות בתשלום ללקוחות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗