GPT
I

Inflect-Micro-v2

קוד פתוח

owensongapache-2.02026-06-25

  • text-to-speech
  • speech-synthesis
  • local-tts
  • cpu
  • edge-ai

מודל הקראת טקסט זעיר שמייצר אודיו מלא באנגלית עם קול גברי קבוע. הוא מתאים למי שחייב להריץ דיבור מקומי ומהיר על מעבד רגיל בלי לגרור ספריות כבדות ותשתיות יקרות.

  • 63.9 MBמשקל הקבצים
  • 774הורדות בחודש
  • 438לייקים

מה זה

מדובר במודל שמבוסס על משפחת VITS וממיר טקסט ישירות לגל קול בפורמט מונו של 24 קילוהרץ. עם פחות מעשרה מיליון פרמטרים ומשקל קובץ של 37.53 מגה בייט ברמת דיוק רגילה, הוא מגיע עם מפענח פנימי שלא דורש מודל ווקודר נפרד. הטקסט עובר עיבוד פונטי דרך כלי ייעודי באנגלית, ומחולק למקטעים לפי סימני פיסוק לפני ההרצה כדי להתמודד עם פסקאות ארוכות.

בבדיקות האזנה עיוורות בקהילה המודל הועדף בשיעור של 66.2 אחוזים מול חלופות קלות משקל. במבחני זיהוי דיבור של שני מודלים חיצוניים הוא רשם שיעור שגיאות מילים סמנטי ממוצע של 3.99 אחוזים, נתון שמראה שהדיבור נשאר ברור ומובן למרות הדחיסה הקיצונית. במדד הטבעיות החישובי UTMOS22 הוא קיבל ציון של 4.395, מה שמציב אותו ברמה גבוהה מאוד ביחס לגודל הפיזי שלו.

מתאים ל

  • הקראת ממשק במכשירי קצה

    משקל קטן של פחות מארבעים מגה בייט שרץ פי שישה מזמן אמת על מעבד פשוט בלי כרטיס מסך.

  • הקראת מאמרים אופליין

    חלוקה מובנית של פסקאות ארוכות לפי סימני פיסוק עם שמירה על קצב יציב ומובנות גבוהה.

  • הודעות קוליות במערכות פנימיות

    רישיון מסחרי חופשי והרצה מקומית מלאה שאינה תלויה ברשת, שרתים חיצוניים או עלויות שימוש.

איפה זה נופל

המודל מוגבל לאנגלית בלבד וכולל קול גברי סינתטי אחד קבוע. אין פה אפשרות לשיבוט קול לפי דגימה, ואין תמיכה בעברית ללא אימון מחדש של השכבות הפונטיות על נתונים משלכם. בניסוחים חריגים הקול עלול להישמע מונוטוני, שטוח או חסר יציבות. שמות פחות מוכרים, קיצורים, מספרים ומילים שנכתבות זהה אך נהגות אחרת רגישים לשגיאות של מנגנון הטקסט. מכיוון שטקסטים ארוכים מפוצלים למקטעים עם השתקה קצרה ביניהם, המעברים לא תמיד ישמעו שוטפים כמו מודל שפה שמייצר דיבור רציף.

שאלות
נפוצות

האם המודל יודע לדבר עברית?

לא, הוא מוגדר ומאומן אך ורק לאנגלית עם קול גברי מובנה. המפתח שחרר ערכת התאמה ניסיונית למי שרוצה לאמן שפה חדשה, אבל זה דורש מערך נתוני דיבור משלכם, החלפת מנגנון הפונמות והרצת אימון מחדש.

איך מבטיחים שהקול יישמע אותו דבר בכל הרצה?

המודל כולל רכיב סטוכסטי שמייצר גיוון טבעי בדיבור, מה שיכול לשנות מעט את הקצב והאינטונציה. כדי לקבל תוצאה זהה לחלוטין בכל קריאה עם אותו טקסט, צריך להעביר מספר קבוע בפרמטר הסיד.

איך מריצים

מורידים את הקבצים מחב האגינג פייס ומתקינים את התלויות הרגילות של פייתון. הקוד מריץ את המודל ישירות על מעבד מקומי או כרטיס גרפי באמצעות קריאה פשוטה עם הגדרות מהירות, גיוון וסיד לשחזור מדויק. על מעבד של שרת ענן עם ארבעה תהליכונים בלבד הוא מייצר שמע בקצב של פי 6.28 מזמן אמת, כך שאין שום חובה להחזיק כרטיס גרפי.

אם אתם רצים בסביבה מוגבלת בלי פייתון מלא, יש למפתח מאגר נפרד עם גרסת ONNX רשמית שעובדת עם DirectML ומעבדים רגילים. למודל יש גרסת ננו קטנה יותר מתחת לארבעה מיליון פרמטרים, אבל מיקרו שומר על איכות צליל עדיפה. אם אתם צריכים רק דיבור באנגלית עבור ממשק פנימי או מכשיר קצה, הריצה המקומית פשוטה וחינמית, ועדיף שירותי ענן רק כשאתם חייבים עשרות שפות, קולות מותאמים אישית או שיבוט קול בזמן אמת.

pip install -U huggingface_hub
hf download owensong/Inflect-Micro-v2

הקבצים

83 קבצים במאגר, 63.9 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים משוחררים תחת רישיון אפאצ׳י 2.0. הרישיון מאפשר שימוש מסחרי, שינוי הקוד והפצה בתוך מוצרים סגורים בלי תשלום תמלוגים, בתנאי ששומרים על הצהרת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗