GPT
O

OuteTTS-0.3-1B

קוד פתוח

OuteAIcc-by-nc-sa-4.02025-01-13

  • outetts
  • safetensors
  • olmo
  • text-to-speech

המודל מציע מנוע דיבור מבוסס שפה שמייצר שמע טבעי בשש שפות. הוא מתאים למי שצריך תמיכה מלאה בסימני פיסוק ורוצה להריץ קול מקומית מחבילה קומפקטית של 1.2 מיליארד פרמטרים.

  • 1.2Bפרמטרים
  • 4,096טוקנים בהקשר
  • 2.2 GBמשקל הקבצים
  • 207הורדות בחודש

מה זה

מדובר במודל שפה מסוג Olmo שאימנו אותו מחדש להמרת טקסט לדיבור בעזרת טוקניזציה ייעודית של קול. הוא מייצר שמע באנגלית, יפנית, קוריאנית, סינית, צרפתית וגרמנית, על בסיס עשרים אלף שעות אימון שכוללות בין היתר את מאגר אמיליה. החידוש העיקרי בגרסה הנוכחית הוא המרה מפורשת של סימני פיסוק, כולל נקודות, פסיקים וסימני שאלה, לטוקנים מיוחדים בתוך הטקסט. הטיפול הזה משפר את שטף הדיבור ומונע את הקריאה הרובוטית שמאפיינת מערכות קטנות ללא מודעות תחבירית.

בניגוד למערכות TTS קלאסיות שדורשות צנרות עיבוד מורכבות ונפרדות, המודל הזה שומר על ארכיטקטורת רשת שפה רגילה לחלוטין. הגישה הזו מאפשרת עבודה ישירה מול ספריות סטנדרטיות ותמיכה בהרחבה עתידית של דיבור לדיבור, לצד ניסיונות ראשוניים לשליטה על גוון הקול ישירות מהטקסט.

מתאים ל

  • הקראת טקסט באנגלית ובאירופה

    יצירת שמע באנגלית, צרפתית או גרמנית לפודקאסטים ולפרויקטים אישיים, עם זרימת משפטים טבעית הודות לתמיכה בפיסוק.

  • פיתוח כלי קול מקומיים

    הרצה מקומית על מחשב אישי או שרת קטן ללא תלות ברשת וללא עלויות ענן שוטפות.

  • מחקר על שילוב קול ומודלי שפה

    בדיקת ארכיטקטורת שפה שמייצרת טוקנים קוליים וניסויים ביצירת דיבור לדיבור ללא מודלים חיצוניים.

איפה זה נופל

המודל מוגבל ליצירת מקטעים של עד 30 שניות בלבד. אם משתמשים בדגימת קול חיצונית כדי להגדיר דובר, אורך הדגימה יורד מהתקציב הזה, כך שדגימה של 10 שניות משאירה רק כ 20 שניות של יצירת דיבור. פיצ'ר השליטה הקולית נמצא בשלב ניסיוני מוקדם מאוד והמודל מתעלם ממנו לעיתים קרובות בגלל מחסור בנתונים. בנוסף, אין בו שום תמיכה בעברית, והוא תומך רק בשש השפות שהוגדרו בכרטיס.

שאלות
נפוצות

האם המודל תומך בהקראת טקסט בעברית?

לא, המודל אומן על שש שפות בלבד: אנגלית, גרמנית, צרפתית, סינית, יפנית וקוריאנית. אין לו תמיכה מובנית בטקסט עברי והוא לא יפיק שמע תקין עבורו.

האם אפשר להשתמש במודל הזה בתוך אפליקציה בתשלום?

אי אפשר, הרישיון כולל סעיף NC שמונע שימוש מסחרי מכל סוג שהוא. אם המטרה היא להרוויח כסף מהמוצר, תצטרכו לחפש מודל עם רישיון פתוח לחלוטין כמו אפאצ'י או MIT.

מה צריך לעשות כדי להקריא טקסט ארוך?

המודל תומך במקטעים של עד שלושים שניות בכל ריצה. כרגע צריך לחתוך את הטקסט למשפטים קצרים באופן עצמאי, כי מנגנון עיבוד באצוות מובנה עדיין לא הוטמע בספרייה.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.2 גיגה בייט בדיוק bfloat16, כך שאפשר להריץ אותו בקלות על כרטיס מסך בודד עם 6 או 8 גיגה בייט זיכרון, או אפילו באמצעות גרסת GGUF על מעבד רגיל. ההתקנה מתבצעת ישירות דרך פקודת pip לחבילת outetts.

גרסת ה 1B מספקת תוצאות שמע איכותיות יותר מגרסת ה 500M בזכות כמות כפולה של שעות אימון, אבל אם אתם חייבים זמן תגובה אפסי בענן בלי לנהל תשתית מקומית, עדיף להשתמש ב API חיצוני של ספקי ענן.

pip install -U huggingface_hub
hf download OuteAI/OuteTTS-0.3-1B

הקבצים

8 קבצים במאגר, 2.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC-BY-NC-SA 4.0 בגלל השימוש במאגר המידע Emilia. המשמעות היא איסור מוחלט על שימוש מסחרי, וחובה לשתף כל תוצר או מודל נגזר תחת אותם תנאים בדיוק. אם אתם בונים מוצר רווחי, המודל הזה פסול לשימוש.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗