GPT
A

audio8-TTS-0.1B-ONNX-INT8

קוד פתוח

Edge0apache-2.02026-08-25

  • onnxruntime
  • onnx
  • arktts
  • int8
  • audio

המודל מציע הקראת טקסט ושיבוט קול על מעבד רגיל בלי שום תלות ב־CUDA. הוא מכוון למי שצריך מנוע דיבור מקומי וקל במיוחד שלא חונק את הזיכרון.

  • 8,192טוקנים בהקשר
  • 818 MBמשקל הקבצים
  • 1,851הורדות בחודש
  • 66לייקים

מה זה

מדובר בגרסת ONNX מכווצת ב־INT8 של מודל DualAR המשלב ארכיטקטורת Falcon-H1 היברידית של תשומת לב יחד עם Mamba, בהיקף של כ־100 מיליון פרמטרים. המערך מחולק למודל איטי שמנבא טוקן סמנטי אחד לכל פריים אודיו, מודל מהיר שמנבא את ספרי הקוד האקוסטיים, ומפענח אודיו ברמת FP16 שמפיק גל קול של 44.1 קילו-הרץ.

היתרון הגדול כאן הוא הריצה כגרף מחזורי לכל טוקן בנפרד, מה שחוסך את הצורך בספריות כבדות כמו PyTorch בזמן ריצה. במבחני המפתחים על שמונה תהליכונים, המודל האיטי דורש כ־19 מילי-שניות לטוקן והמודל המהיר דורש כ־8 מילי-שניות לפריים. זה אומר שבפועל מקבלים יצירת קול שוטפת לחלוטין על מעבד סטנדרטי בלי להחזיק כרטיס מסך ייעודי דלוק.

מתאים ל

  • שרת דיבור מקומי ורזה

    הוא צורך 0.6 גיגה-בייט זיכרון ומספק ממשק תואם OpenAI ישירות מהמעבד.

  • שיבוט קול מהיר בקצה

    הוא מאפשר רישום קול מדגימה של חצי דקה בלבד ללא צורך בכרטיס מסך.

  • הקראת ממשקים רב-לשוניים

    הוא תומך ב־11 שפות כולל אנגלית, גרמנית וצרפתית במהירות ריצה גבוהה.

איפה זה נופל

המודל מוגדר כגרסת תצוגה מקדימה, ועברית אינה ברשימת השפות הנתמכות, כך שהוא לא יתאים לממשקים בעברית. בנוסף, קוונטיזציה ל־INT8 משנה את דגימת הטוקנים ביחס למקור, מה שעלול לפגוע ביציבות ובדיוק של שיבוט הקול אם הקלט ארוך מדי, רועש, או מכיל תמלול לא מדויק.

אותה משפחה

audio8-TTS יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל להקראת טקסטים בעברית?

לא. רשימת השפות כוללת 11 שפות בלבד כמו אנגלית, סינית, גרמנית וצרפתית, ועברית אינה נתמכת כרגע בגרסה זו.

האם חייבים GPU כדי להריץ את שיבוט הקול?

אין צורך ב־GPU כלל. כל הרכיבים כולל מודל הקידוד לרישום קולות חדשים רצים על מעבד רגיל באמצעות onnxruntime.

איך מריצים

ההרצה נעשית באמצעות onnxruntime על ה־CPU, עם תמיכה שנבדקה על לינוקס x86_64 ועל מעבדי אפל סיליקון. המודלים עצמם שוקלים כ־818 מגה-בייט, ובזמן הפעלה שוטפת התהליך תופס כ־0.6 גיגה-בייט זיכרון בלבד, כך שגם שרת וירטואלי קטן או מחשב קצה יריצו אותו בלי מאמץ.

אם אתם צריכים רק הקראה נקודתית באפליקציית ענן גדולה, קריאה לשירות מנוהל חיצוני כנראה תחסוך תחזוקה. פריסה עצמאית של המודל הזה מתאימה כשחשוב לכם לעבוד אופליין, לחסוך עלויות תעבורה, או להטמיע ממשק מקומי תואם OpenAI שכבר מגיע מובנה בקוד ההרצה.

pip install -U huggingface_hub
hf download Edge0/audio8-TTS-0.1B-ONNX-INT8

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה פנימית או חיצונית בתוך מוצר. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וקובץ הרישיון המקורי של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗