GPT
O

OuteTTS-0.1-350M-GGUF

קוד פתוח

OuteAIcc-by-4.02024-11-03

  • gguf
  • text-to-speech
  • en
  • endpoints_compatible

המרת טקסט לדיבור בקובץ קטן שרץ ישירות על מעבד מקומי בלי תלות ברשת. הוא מתאים למי שרוצה לשבט קול באנגלית על חומרה חלשה בלי להקים תשתית כבדה.

  • 4.3 GBמשקל הקבצים
  • 13,725הורדות בחודש
  • 43לייקים

מה זה

המודל ממיר טקסט לקול באמצעות ארכיטקטורת LLaMa רגילה לחלוטין, ללא מתאמים חיצוניים או רשתות ייעודיות לעיבוד שמע. הרעיון פה פשוט. הטקסט והאודיו מיוצגים יחד כטוקנים, כשהאודיו מעובד בקצב של 75 טוקנים לשנייה בעזרת WavTokenizer ומיושר מול המילים באמצעות CTC. הוא מבוסס על מודל הבסיס Oute3-350M-DEV ומציע גם יכולת שיבוט קול מתוך קובץ דגימה קצר ומלל תואם.

הגישה הזו שונה מרוב פתרונות הדיבור שדורשים שילוב של מספר מודלים נפרדים. עם זאת, הדוגמאות שהיוצרים עצמם מציגים מראות שהוא מתקשה ביציבות. במשפט פשוט על גילוי כוכב לכת, המודל נכשל חלקית בהקראת הטקסט המדויק בטמפרטורה נמוכה של 0.1, והצליח לייצר פלט עקבי רק כשהעלו את הטמפרטורה ל־0.7. המשמעות היא שאין פה אמינות מוחלטת והתוצאה תלויה מאוד בכוונון ידני.

מתאים ל

  • הקראת התראות קצרות באנגלית

    מתאים להודעות קצרות של מילה עד משפט במערכות מקומיות שרצות על מעבד חלש ללא חיבור לאינטרנט.

  • ניסויי שיבוט קול מקומיים

    הוא מאפשר לבדוק שיבוט קול מקובץ שמע קצר ומלל ישירות בקוד פייתון בלי לשלוח שמע לשרתים חיצוניים.

  • פיתוח כלי דיבור מוטמעים

    התאימות לפורמט GGUF מאפשרת לשלב מודל שמע קל משקל בתוך אפליקציות שולחניות קיימות מבוססות llama.cpp.

איפה זה נופל

היוצרים מבהירים שמדובר בגרסה ניסיונית ראשונית עם מגבלות משמעותיות. בגלל הגודל הקומפקטי, הוא נוטה לעיתים קרובות לשנות מילים, להוסיף מילים שלא היו, או להשמיט מילים לגמרי. אוצר המילים מוגבל עקב נתוני האימון, הקלט חייב להיות מחרוזת טקסט בלבד, והוא עובד באנגלית בלבד ללא שום תמיכה בעברית. הדיוק שלו צונח משמעותית במשפטים ארוכים, מה שהופך אותו ללא שמיש להקראת פסקאות ברצף.

אותה משפחה

OuteTTS-0.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו להקראת טקסט בעברית?

לא. המודל אומן על מאגרי מידע באנגלית בלבד כמו LibriTTS-R ו־MLS. אין לו תמיכה בצלילים או בפונטיקה של עברית והוא מוגבל למחרוזות באנגלית בלבד.

למה המודל מדלג על מילים במשפטים שאני מזין לו?

זה נובע ישירות מגודלו המזערי של המודל, 350 מיליון פרמטרים בלבד. היוצרים מציינים במפורש שהוא נוטה להשמיט, לשבש או להוסיף מילים, וממליצים להזין רק משפטים קצרים ולשחק עם הטמפרטורה.

האם הגרסה הזו מומלצת לפרויקט חדש?

לא בהכרח. בעמוד המודל מצוין במפורש שכבר יצאה גרסה חדשה יותר, OuteTTS-0.2-500M, ולכן כדאי לבדוק אותה לפני שמשקיעים זמן בהטמעה של גרסה 0.1.

איך מריצים

אתם מתקינים את חבילת outetts בפייתון ומריצים ישירות מול קובץ ה־GGUF דרך InterfaceGGUF. בזכות המשקל הנמוך של 350 מיליון פרמטרים והתאימות ל־llama.cpp, אפשר להריץ אותו בלי שום בעיה על מעבד של מחשב נייד רגיל, בלי כרטיס מסך ייעודי ובלי לחשוב על VRAM.

הקריאה מחייבת הגדרת פרמטרים של טמפרטורה ועונש על חזרתיות, ואם לא מספקים דגימת קול הוא מייצר מאפייני דובר אקראיים. שווה להריץ אותו לבד רק אם יש לכם צורך מובהק בפרטיות או בעבודה ללא חיבור רשת. אם אתם צריכים הקראה מדויקת ושוטפת לאפליקציה חיה, API חיצוני של שירות דיבור מבוסס ייתן תוצאה אמינה בהרבה בלי שתצטרכו לנהל נפילות של מילים.

ollama run hf.co/OuteAI/OuteTTS-0.1-350M-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא CC BY 4.0, שמתיר שימוש מסחרי, שינוי והפצה של המודל בתוך מוצרים. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים וציון הרישיון. שימו לב שהיוצרים מחריגים כל אחריות לתקלות או לנזקים ישירים ועקיפים שעלולים להיגרם מהשימוש בו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗