GPT
A

Audio8-TTS-Preview-0.6B-ONNX-INT4

קוד פתוח

Edge0apache-2.02026-07-31

  • onnxruntime
  • onnx
  • int4
  • audio
  • text-to-speech

מודל הקראת טקסט ושיבוט קול קומפקטי במיוחד, שעבר קוונטיזציה לריצה מקומית על מעבד רגיל. הוא מאפשר לייצר אודיו באיכות גבוהה בלי לגעת בשרת ענן או להחזיק כרטיס מסך ייעודי.

  • 968 MBמשקל הקבצים
  • 1,481הורדות בחודש
  • 54לייקים

מה זה

המודל הזה לוקח ארכיטקטורת DualAR של כ־600 מיליון פרמטרים ומכווץ אותה לפורמט ONNX עם משקולות INT4, כדי שתוכלו להריץ אותו ישירות על ה־CPU בלי תלויות כבדות כמו PyTorch. הוא מייצר אודיו מונו בתדר דגימה של 44.1 קילוהרץ, ויודע לשבט קול מתוך הקלטת ייחוס קצרה של חצי שנייה עד חצי דקה.

ברמת התמיכה, הדגש כאן הוא על 11 שפות, ביניהן אנגלית, צרפתית, גרמנית וסינית. עברית לא נתמכת ברשימה הזו. היתרון הגדול שלו לעומת חלופות באותו סדר גודל הוא האריזה. כל קבצי ההרצה שוקלים כ־572 מגהבייט בלבד, והוא מגיע מוכן עם שרת מקומי שתומך בפרוטוקול זהה ל־OpenAI, כולל הזרמת אודיו בזמן אמת.

מתאים ל

  • עוזר קולי במכשיר קצה

    צריכת זיכרון של כ־1 גיגהבייט על ה־CPU מאפשרת לשלב דיבור ישירות באפליקציות מקומיות ללא צורך באינטרנט.

  • שרת הקראה פנימי

    הממשק תואם לפרוטוקול של OpenAI, כך שאפשר להחליף שירות ענן יקר בשרת מקומי בלי לשנות שורת קוד בלקוח.

  • שיבוט קול דיסקרטי

    הפקת דיבור בקול של אדם ספציפי מתוך דגימה קצרה, כאשר כל הנתונים נשארים מקומית על המחשב.

איפה זה נופל

זהו שחרור מוקדם, ויש לו חסרונות בולטים. קוונטיזציה לרמת INT4 עלולה לפגוע ביציבות הדגימה ובדיוק הגיית המילים בהשוואה למודל המקורי, ולכן חובה לבדוק כל שפה וקול בנפרד. בנוסף, חלון ההקשר מוגבל ל־2,048 טוקנים שכוללים יחד טקסט ואודיו, כך שהוא לא בנוי להקראת פסקאות ארוכות ברצף.

אם הקלטת הייחוס לשיבוט תהיה רועשת מדי, ארוכה מדי, או שהתמלול שלה לא יהיה מדויק במאה אחוז, איכות החיקוי והיציבות יירדו משמעותית. וכאמור, אין כאן תמיכה בעברית.

אותה משפחה

Audio8-TTS יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בהקראת טקסט בעברית?

לא. רשימת השפות המומלצות כוללת 11 שפות בלבד, ביניהן אנגלית, סינית, צרפתית, גרמנית וספרדית. שימוש בעברית לא נתמך ולא יניב תוצאות שמישות.

חייבים כרטיס מסך של אנבידיה כדי לקבל ביצועים סבירים?

לא, וזה כל הרעיון כאן. הקבצים מותאמים לריצה ישירה על המעבד הראשי בעזרת ONNX Runtime, והמפתחים בדקו אותו בהצלחה על מעבדי אפל מסדרת M2.

כמה דגימת קול צריך לספק כדי לשבט דובר חדש?

מספיק קובץ אודיו בודד באורך שבין חצי שנייה ל־30 שניות. תצטרכו להעלות גם את התמלול המדויק של מה שנאמר בהקלטה כדי שהמערכת תייצר פרופיל קול מקומי.

איך מריצים

להרצה מספיק מעבד רגיל, פייתון 3.11 ומעלה, וספריית onnxruntime. המפתחים בדקו אותו על מחשב מקבוק אייר עם מעבד M2 ו־16 גיגהבייט זיכרון, שם הוא תפס סביב 1 גיגהבייט בטעינה ועד 1.2 גיגהבייט בזמן יצירת אודיו. אם תרצו גם לרשום ולשבט קולות חדשים, תצטרכו להוריד את קובץ האנקודר הנוסף, מה שמקפיץ את צריכת הזיכרון לשיא של 1.55 גיגהבייט.

כל עוד אתם משרתים משתמש יחיד או עובדים מקומית, אין סיבה להשתמש ב־API חיצוני. כדאי לפנות לשירותי ענן בתשלום רק אם אתם צריכים תפוקה של עשרות בקשות מקבילות בו־זמנית, מצב שבו המעבד המקומי שלכם ייחנק מהר מאוד.

pip install -U huggingface_hub
hf download Edge0/Audio8-TTS-Preview-0.6B-ONNX-INT4

הרישיון

המודל והקוד מופצים תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקבצים והפצה שלהם בתוך מוצר פרטי, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗