GPT
L

Llama-OuteTTS-1.0-1B

קוד פתוח

OuteAIcc-by-nc-sa-4.02025-04-06

  • outetts
  • safetensors
  • llama
  • text-to-speech
  • en

מודל דיבור קומפקטי מבוסס Llama 3.2 שמפיק אודיו ישירות מטקסט ותומך בשכפול קול מקובץ קצר של עשר שניות, בלי צורך בטקסט מעובד מראש.

  • 1.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.3 GBמשקל הקבצים
  • 2,292הורדות בחודש

מה זה

המודל מבצע המרת טקסט לדיבור ושכפול קול על גבי ארכיטקטורת LlamaForCausalLM. במקום להסתמך על מערכות עיבוד נפרדות להתאמת מילים או המרת מספרים למילים, הוא מיישר את המילים עצמאית ומטפל במספרים ישירות מתוך הטקסט הגולמי. שילוב של מקודד האודיו DAC של IBM מייצר צליל איכותי יותר, אך דורש יצירה של 150 טוקנים לכל שניית שמע לעומת 75 בגרסאות קודמות.

הוא אומן על כשישים אלף שעות שמע ותומך ברשימה רחבה של שפות ברמות שונות, ביניהן אנגלית, ערבית, צרפתית, יפנית וספרדית עם חשיפה גבוהה, לצד שפות נוספות בחשיפה בינונית. עברית אינה מופיעה ברשימות האימון של המודל, ולכן תוצאות בעברית יהיו לא צפויות במקרה הטוב.

מתאים ל

  • שכפול קול לפודקאסטים וסרטונים

    מאפשר לשכפל קול בצורה מדויקת מדגימה של 10 שניות בלבד, ומפיק אודיו ישירות מטקסט נקי.

  • עוזר קולי מקומי באנגלית

    משקל של 2.3 גיגה בייט מאפשר הרצה שקטה על חומרה מקומית למענה קולי מהיר ללא תלות ברשת.

  • הקראת טקסטים בשפות אירופיות

    תמיכה מובנית ביישור מילים ומספרים בצרפתית, גרמנית או ספרדית בלי צורך בספריות עיבוד מקדימות.

איפה זה נופל

אף על פי שחלון ההקשר מדווח כגדול, בפועל המודל מוגבל ליצירה של כ־42 שניות שמע בריצה בודדת, שהן סביב 8,192 טוקנים, ורצוי לא לעבור 7,000 טוקנים. אם מספקים דגימת קול של 10 שניות לשכפול, חלון היצירה מתקצר לכ־32 שניות. המודל מתקשה בלי דגימת קול חיצונית ומייצר קולות אקראיים ופחות איכותיים כשמריצים אותו בלי רפרנס. מקודד ה־DAC מאבד מידע בקטעי שמע חזקים מדי או צורמים, וערבוב שפות באותו משפט גורר טעויות בהגיית מספרים.

אותה משפחה

Llama-OuteTTS-1.0 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בהקראת טקסטים בעברית?

עברית אינה נכללת ברשימת השפות שאומנו ברמה גבוהה או בינונית. המודל מסוגל טכנית לנסות להגות שפות שלא אומנו, אך התוצאות אינן מובטחות ובדרך כלל יהיו משובשות או לא שמישות.

למה חייבים לתת דגימת קול בכל הפעלה?

הכרטיס מדגיש שבלי רפרנס קולי המודל מייצר מאפייני קול אקראיים באיכות נמוכה. הדרך היחידה לקבל דיבור עקבי וטבעי היא להזין קובץ שמע קצר שממנו המודל שואב סגנון, מבטא וטונאציה.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.3 גיגה בייט בדיוק bfloat16, כך שכרטיס מסך בסיסי או מעבד מודרני מריצים אותו בקלות. קיימת גם גרסת GGUF להרצה מקומית קלה. כדי שהפלט לא ישתבש, חובה להשתמש בחלון קנס חזרתיות של 64 טוקנים אחרונים בלבד עם מקדם 1.1, הגדרה שמיושמת ישירות בספריית outetts הייעודית.

אם אתם צריכים תפוקה מהירה לעשרות משתמשים במקביל או שאין לכם כוח לנהל תלויות אודיו וספריות שרת, עדיף לפנות ל־API מסחרי של דיבור. להרצה מקומית אופליין או פרטית לחלוטין, הדרישות המינימליות מאפשרות להרים אותו כמעט על כל מחשב פיתוח.

pip install -U huggingface_hub
hf download OuteAI/Llama-OuteTTS-1.0-1B

הקבצים

8 קבצים במאגר, 2.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפיתוח והאימון הנוסף שוחררו תחת רישיון cc-by-nc-sa-4.0, לצד תנאי הרישיון המקוריים של Llama 3.2. השימוש מוגבל למטרות לא מסחריות בלבד, מחייב מתן קרדיט, וכל יצירה נגזרת חייבת להיות מופצת תחת אותו הרישיון בדיוק. אי אפשר לשלב אותו במוצר מסחרי סגור.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗