GPT
K

Kokoro-82M-ONNX

קוד פתוח

onnx-communityapache-2.02025-01-12

  • transformers.js
  • onnx
  • style_text_to_speech_2
  • text-to-speech
  • en

מודל הקראת טקסט קטן במיוחד שמגיע מוכן לריצה ישירה בדפדפן או בשרת קל. הוא מייצר דיבור באנגלית עם מגוון קולות בלי תלות בתשתיות ענן כבדות.

  • 1.3 GBמשקל הקבצים
  • 51,215הורדות בחודש
  • 180לייקים

מה זה

מדובר בהמרה לפורמט ONNX של מודל המונה 82 מיליון פרמטרים, המיועד להפקת דיבור מטקסט. המאגר כולל מספר גרסאות מכווצות שמתאימות במיוחד להרצה מקומית, החל מקובץ של 326 מגה בייט ברמת דיוק מלאה ועד לקבצים קטנים של 86 או 92.4 מגה בייט בכימות של 8 ביט.

הוא מספק 11 קולות מובנים שמתחלקים למבטא אמריקאי ובריטי, גברים ונשים, ומוציא אודיו בקצב דגימה של 24kHz. היתרון המשמעותי שלו מול מודלים מתחרים בגודל הזה הוא היכולת לשמור על איכות הפקה טובה גם לאחר כיווץ אגרסיבי, לצד התאמה ישירה לספריית transformers.js.

מתאים ל

  • הקראה מקומית בדפדפן

    הקובץ קטן מספיק להורדה מהירה ומשתלב ישירות ב־JavaScript ללא צורך בשרת מתווך.

  • עוזר קולי במכשיר קצה

    צריכת הזיכרון הנמוכה בגרסאות ה־8 ביט מאפשרת מענה קולי מהיר גם על חומרה חלשה.

  • המרת מאמרים לאודיו באנגלית

    מגוון המבטאים האמריקאיים והבריטיים נותן גמישות סבירה להקראת תוכן כתוב.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא השפה, המודל תומך באנגלית בלבד ואין לו שום תמיכה בעברית. בנוסף, הוא כולל רשימה סגורה וקבועה מראש של קולות, כך שאי אפשר לאמן אותו על דגימות קול חדשות או לבצע שיבוט קול מתוך הקוד המצורף. צריך גם לבדוק את איכות ההגייה בגרסאות המכווצות ביותר לפני שילוב בתהליך ייצור.

אותה משפחה

Kokoro יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל כדי להקריא טקסט בעברית?

לא. המודל אומן ותומך אך ורק באנגלית, לפי הגדרות המפתח. הזנת טקסט בעברית לא תניב תוצאה תקינה.

באיזו גרסת קובץ מומלץ לבחור לפרויקט רגיל?

גרסת model_quantized.onnx ב־8 ביט היא נקודת הפתיחה המאוזנת ביותר. היא שוקלת 92.4 מגה בייט בלבד, נטענת מהר, ושומרת על איכות צליל טובה מאוד בהשוואה למקור.

איך מריצים

ההרצה פשוטה ואינה דורשת מאיץ גרפי חזק. אפשר להשתמש בחבילת kokoro-js בתוך סביבת JavaScript או Node, וכן בסקריפט פייתון קצר עם ספריית scipy. קובץ ה־8 ביט ששוקל 92.4 מגה בייט רץ בקלות על מעבד רגיל של לפטופ או שרת בסיסי בלי לחנוק את הזיכרון.

גרסאות ה־q8 או ה־fp16 יתאימו לרוב המקרים שבהם רוצים תגובה מהירה בלי עלויות שרת. אם אתם צריכים לטפל באלפי פניות במקביל או בקבצי אודיו באורך שעות, עדיף להשתמש בפתרון ענן מנוהל במקום לנהל את משאבי המעבד בעצמכם.

pip install -U huggingface_hub
hf download onnx-community/Kokoro-82M-ONNX

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה של המודל בתוך מוצר פרטי, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗