GPT
I

Inflect-Nano-v2

קוד פתוח

owensongapache-2.02026-06-25

  • text-to-speech
  • speech-synthesis
  • local-tts
  • cpu
  • edge-ai

הפקת דיבור שלמה שלוקחת פחות מ־16 מגה-בייט ומספקת קול קבוע באנגלית בלי תלות בשירותי ענן. הפתרון מיועד למי שחייב אפס עלויות שרת וזמני תגובה מהירים על מעבד רגיל.

  • 43.3 MBמשקל הקבצים
  • 611הורדות בחודש
  • 139לייקים

מה זה

הארכיטקטורה מבוססת על משפחת VITS ומכילה פחות מארבעה מיליון פרמטרים, כולל מפענח גל קול שמפיק אודיו מונו באיכות 24 קילוהרץ. המשקל הכולל של המשקולות בפורמט נקודה צפה עומד על 15.97 מגה-בייט בלבד, מה שמציב אותו ברמת גודל נמוכה משמעותית מפתרונות מקומיים ותיקים כמו Piper Low או KittenTTS. הוא שומר על שרשרת עיבוד מקומית מלאה מטקסט ישירות לאודיו, בלי צורך במודל ווקודר נפרד ברקע.

במבחני תפיסה עיוורים מול חלופות קומפקטיות, המודל קיבל העדפת מאזינים של 63.9 אחוזים. במדדי בהירות המבוססים על מערכות זיהוי דיבור נפרדות, הוא רושם שיעור שגיאות מילים ממוצע של 4.21 אחוזים על טקסטים שלא נראו באימון. המספרים האלה מראים שגם בקיצוץ מסיבי של נפח המודל, הדיבור נשאר מובן וברור ולא נמרח לרעש דיגיטלי.

מתאים ל

  • הקראת ממשק במכשירי קצה

    משקל של 16 מגה-בייט מאפשר הטמעה ישירה באפליקציות שולחניות או רכיבי חומרה חלשים בלי חיבור לאינטרנט.

  • מענה קולי בשרתים רזים

    הפקה בקצב מהיר פי עשרה מזמן אמת על מעבד רגיל חוסכת צורך בכרטיסי מסך יקרים.

  • קריאת טקסטים קצרים באופליין

    האינטגרציה המלאה מטקסט לאודיו מייצרת קבצי שמע מקומיים מתוך מחרוזות בדידים באנגלית.

איפה זה נופל

המודל מוגבל לאנגלית בלבד ומגיע עם קול גברי יחיד וקבוע. אין כאן שכפול קולות, ואי אפשר להשמיע עברית בלי לאמן מודל חדש לגמרי דרך ערכת ההתאמה הניסיונית. פסקאות ארוכות נחתכות לפי סימני פיסוק ומחוברות יחד עם השהיות קצרות, מה שעלול לייצר מעברים מעט מקוטעים. מילים לא שגרתיות, קיצורים, מספרים ושמות זרים גורמים לו לפעמים להישמע מונוטוני או לשבש הגייה, והוא לא נבדק למערכות קריטיות.

אותה משפחה

Inflect-Nano יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

לא, המודל אומן על אנגלית בלבד ומכיל מילון פונמות שמיועד לשפה זו. כדי להשמיע עברית תצטרכו להשתמש בערכת ההתאמה של הפרויקט, להביא דאטהסט מוקלט ולבצע אימון מחדש.

האם אפשר לשנות את הקול של המודל בזמן ריצה?

אין במודל יכולת שכפול קול מקובץ שמע קצר. המודל כולל קול גברי סינתטי אחד שמובנה בתוך המשקולות שלו, והחלפת קול דורשת החלפה של המודל או אימון ייעודי מראש.

כמה זיכרון עבודה נדרש כדי להריץ אותו?

בגלל גודלו הזעיר, המודל דורש עשרות מגה-בייט בודדים של זיכרון עבודה בלבד. הוא פועל בנוחות על מחשבים פשוטים או מופעי ענן עם מעבד יחיד וללא מאיץ גרפי.

איך מריצים

ההרצה פשוטה ביותר ואינה דורשת כרטיס גרפי ייעודי. על מעבד רגיל של שרת עם ארבעה תהליכונים, המודל מפיק קול בקצב מהיר פי 10.72 מזמן אמת, כך שכל שרת בסיסי או מחשב קצה מריץ אותו בלי עומס מורגש. כל מה שצריך זה להתקין את ספריית הפייתון של Hugging Face, להוריד את הקבצים ולקרוא למחלקת ההסקה המצורפת.

לצד גרסת הפייתון הרגילה, קיימת גרסת מודל מקבילה עבור סביבת ONNX Runtime שחוסכת ייבוא של PyTorch ומאפשרת שימוש ישיר ב־DirectML או בסביבות קלות משקל. אם אתם צריכים רק עשרות פניות בודדות ביום לקולות מתחלפים בהרבה שפות, קריאה ל־API חיצוני עדיפה בהרבה מתחזוקת תשתית עצמאית.

pip install -U huggingface_hub
hf download owensong/Inflect-Nano-v2

הקבצים

83 קבצים במאגר, 43.3 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי והפצה בתוך מוצרים סגורים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים וצירוף עותק של הרישיון המקורי בקוד או בתוכנה שאתם מפיצים. אין דרישה לפתוח את הקוד של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗