GPT
A

Audio8-TTS-Preview-0.1b

קוד פתוח

Edge0other2026-08-19

  • transformers
  • safetensors
  • arktts
  • feature-extraction
  • audio

מודל המרת טקסט לדיבור זעיר שמציע שכפול קולות מאפס בלי צורך בשרתים כבדים. הוא פונה למי שמחפש פתרון קל משקל באנגלית ובסינית שרץ על מעבד רגיל.

  • 170Mפרמטרים
  • 8,192טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • 8,365הורדות בחודש

מה זה

המודל מבוסס על רשת יוצרת של כ־170 מיליון פרמטרים לצד מפענח קודק נפרד של כ־120 מיליון פרמטרים, מה שמסתכם במערכת כוללת קטנה בהרבה ממודלי הקול הנפוצים. המבנה שלו מפוצל לשני מסלולים, מסלול איטי לחיזוי טוקנים סמנטיים ומסלול מהיר שמייצר את מקטעי הקול בהתבסס עליהם.

בבדיקות השגיאה באנגלית ובסינית הוא מציג שיעורי שגיאה נמוכים שמקבילים למודלים ענקיים של כמה מיליארדי פרמטרים. עם זאת, מדד הדמיון לקול המקורי בשכפול עומד על 56.7 אחוז באנגלית ו־68.2 אחוז בסינית, תוצאה נמוכה בבירור מזו של מערכות כבדות יותר, כך שהוא קורא היטב את הטקסט אבל מחקה את גוון הקול בצורה פחות מדויקת.

מתאים ל

  • הקראת טקסטים מקומית על CPU

    גרסת המעבד תופסת פחות מחצי גיגה זיכרון ומאפשרת דיבוב אנגלית בלי שרת גרפי ייעודי.

  • שכפול קול בסיסי לאפליקציות

    מתאים למוצרים עם תקציב חומרה נמוך שמחפשים חיקוי קול מהיר ולא דורשים התאמה מושלמת.

  • ממשקי קול מקבילים בסינית

    מציג שיעור שגיאה של 1.13 אחוז בסינית בתוך מעטפת פרמטרים זעירה.

איפה זה נופל

המודל נבנה כגרסת תצוגה מקדימה ומכוון בעיקר לאנגלית ולסינית. שפות אחרות כמו צרפתית, גרמנית, ספרדית, איטלקית, יפנית או קוריאנית מציגות אחוזי שגיאה גבוהים בהרבה, שמגיעים ליותר מ־14 אחוז באיטלקית. עברית כלל לא נתמכת כאן.

איכות הפלט והיציבות שלו נפגעות מאוד אם מקטע הקול שמשמש כדוגמה לשכפול ארוך מדי, כולל רעשי רקע, או אם התמלול שלו אינו תואם באופן מושלם לנאמר בו.

אותה משפחה

Audio8-TTS יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בדיבור בעברית?

לא. המודל תומך בעיקר באנגלית ובסינית, עם תמיכה ניסיונית בלבד בשש שפות נוספות כמו יפנית, גרמנית וצרפתית. עברית אינה מופיעה ברשימת השפות והמודל אינו מתאים להפקת דיבור בעברית.

מה נדרש כדי לשכפל קול בצורה מוצלחת?

צריך לספק קובץ אודיו קצר ונקי מרעשים של הדובר יחד עם תמלול מדויק של מה שנאמר בו. אי־דיוק בטקסט או הקלטה רועשת יפגעו ישירות ביציבות של הקול שיופק.

איך מריצים

המודל פועל בסביבת פייתון מעל גרסה 3.11 עם חבילות PyTorch וטרנספורמרס, ודורש הרצת קוד מרוחק בגלל הארכיטקטורה הייחודית שלו. מומלץ להשתמש במאיץ גרפי מבוסס קודה להרצה רגילה.

למי שרוצה להימנע מחומרה יקרה, יש גרסת אינטגרציית מעבד מומרת ב־ONNX INT8 שתופסת כ־0.4 גיגה־בייט זיכרון בלבד על לינוקס x86_64 ומספקת שירות קול בלי להסתמך על PyTorch. שווה לשלם ל־API חיצוני רק אם אתם חייבים שכפול קול ברמת דיוק גבוהה במיוחד או אם השפה שלכם אינה אנגלית או סינית.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="Edge0/Audio8-TTS-Preview-0.1b")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון קהילתי ייעודי של Audio8. שימוש אישי, מחקרי וחינוכי פתוח בחינם. שימוש מסחרי מותר בחינם רק לחברות וישויות שההכנסה השנתית הכוללת שלהן נמוכה משני מיליון דולר. ארגון שמכניס סכום כזה ומעלה מחויב לקבל רישיון מסחרי נפרד בכתב מהיוצרים.

הרישיון המלא בעמוד המודל ↗