GPT
A

Audio8-TTS-Preview-0.6b

קוד פתוח

Edge0apache-2.02026-07-28

  • transformers
  • safetensors
  • arktts
  • feature-extraction
  • audio

מודל דיבור קטן במיוחד שמשחזר קול מדגימה קצרה ומייצר אודיו נקי. הוא מתאים למי שחייב להריץ דיבוב בעצמו ורוצה דיוק גבוה בלי להחזיק כרטיסי מסך כבדים.

  • 601Mפרמטרים
  • 2,048טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 12,002הורדות בחודש

מה זה

מדובר במודל טקסט לקול עם ארכיטקטורת DualAR שכוללת מודל איטי לטוקנים סמנטיים ומודל מהיר לקודבוקים אקוסטיים, לצד קודק מובנה של 44.1 קילוהרץ שמייתר הורדת קודקים נפרדים. הוא תומך ב־11 שפות עיקריות, כולל אנגלית, סינית, צרפתית, גרמנית וספרדית, ויודע לשבט קול מתוך קובץ התייחסות עם תמלול תואם או להקריא ישירות בלי דגימה.

למרות נפח של כ־601 מיליון פרמטרים בלבד, המדידות שלו בטבלאות מראות שיעור שגיאות מילים של 1.506 באנגלית במבחן Seed-TTS, תוצאה נקייה יותר ממודלים ששוקלים פי ארבעה ושמונה ממנו. מצד שני, במדד הדמיון לקול המקורי הוא מקבל 63.2 באנגלית, שזה נמוך יותר ממתחרים כבדים כמו VoxCPM2 שמגיעים ל־75.3. הוא הוגה מדויק, אבל תופס פחות מניירות של הדובר.

מתאים ל

  • הקראת טקסט מקומית על לפטופ

    גרסת ה־INT4 צורכת רק 1 גיגה זיכרון במעבד, מושלמת לתוכנות שולחניות ללא חיבור רשת.

  • שרת שמע מבוסס SGLang

    המודל מגיע עם מתאם ייעודי לממשק OpenAI עבור תשתית פנימית מהירה מרובת פניות.

  • דיבוב רב־לשוני באנגלית וספרדית

    הוא מציג שיעור שגיאות מילים נמוך במיוחד בלי לדרוש שרת ענק עם כרטיסי מסך מרובים.

איפה זה נופל

זהו שחרור מוקדם, ולכן כיסוי השפות מצומצם מאוד ואין בו שום תמיכה בעברית. שיבוט הקול מחייב התאמה מדויקת בין הטקסט של דגימת הרפרנס למילים שנאמרו בה, ורעשי רקע או קטעים ארוכים מדי יפגעו ביציבות ובאיכות הסאונד. בנוסף, חלון ההקשר מוגבל ל־2,048 טוקנים של טקסט ואודיו יחד, כך שהוא לא בנוי לרינדור של טקסטים ארוכים ברצף אחד.

אותה משפחה

Audio8-TTS יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע להקריא טקסטים בעברית?

לא. המודל הוגדר כגרסת תצוגה מוקדמת ותומך רק ב־11 שפות ספציפיות כמו אנגלית, סינית, צרפתית וגרמנית. עברית אינה מופיעה ברשימה ולא תעבוד בצורה תקינה.

האם חייבים כרטיס מסך חזק כדי להפעיל אותו?

לא חובה. קיימת גרסת ONNX דחוסה ל־INT4 שמיועדת להרצה חלקה על גבי מעבדים רגילים, ודורשת רק כ־1 גיגה זיכרון פנוי כדי לייצר אודיו.

האם דרוש מודל נוסף כדי להפוך את הפלט לקובץ שמע?

לא, הקודק האקוסטי של 44.1 קילוהרץ כבר ארוז בתוך המאגר ומבצע גם קידוד רפרנס וגם פענוח ישיר לגל קול, בלי תלות נוספת.

איך מריצים

להרצה מלאה ב־PyTorch נדרשים כרטיס מסך של אנבידיה ופייתון מודרני, עם הרשאות remote code מופעלות בהגדרות הטעינה. לשרת ייצור יש מתאם ייעודי לפרויקט SGLang Omni שכולל paged attention, אצווה דינמית וממשק תואם לפרוטוקול של OpenAI. זה פתרון טוב למי שבונה תשתית שירות עצמאית.

אם אין לכם GPU ייעודי, יש גרסת ONNX מכווצת ב־INT4 שרצה ישירות על המעבד, וצורכת כ־1 גיגה של זיכרון בלבד בסביבת אפל M2. במקרים שבהם אתם צריכים רק קריאה פה ושם ולא רוצים לנהל שרתים או סשנים של אודיו, עדיף להשתמש ב־API מוכן ברשת.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="Edge0/Audio8-TTS-Preview-0.6b")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0 המלא. מותר להשתמש בהם לצרכים מסחריים, לשנות את הקבצים ולשלב אותם במוצרים שלכם בלי לשלם תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗