GPT
V

VoxCPM1.5

קוד פתוח

openbmbapache-2.02025-12-05

  • voxcpm
  • safetensors
  • text-to-speech
  • speech
  • speech generation

מודל המרת טקסט לדיבור שמייצר אודיו ברציפות ללא טוקניזציה דיסקרטית, ומסוגל לשכפל קול מדגימה קצרה באיכות 44.1kHz. הוא מתאים למי שצריך סינתזה אקספרסיבית באנגלית או סינית עם שיהוי נמוך.

  • 802Mפרמטרים
  • 1.8 GBמשקל הקבצים
  • 21,632הורדות בחודש
  • 362לייקים

מה זה

הארכיטקטורה של המודל נשענת על MiniCPM-4 ומחברת מודל שפה אוטורגרסיבי עם דיפוזיה, במטרה לייצר ישירות ייצוגי קול רציפים במקום להמיר פונמות לטוקנים דיסקרטיים של אודיו. השיטה הזו שומרת על אינטונציה טבעית יותר של המשפט ומונעת את הצליל המכני שמאפיין מערכות פשוטות יותר. האימון בוצע על מאגר דו לשוני של 1.8 מיליון שעות דיבור באנגלית ובסינית, וזה מאפשר לו לקרוא את הטקסט, להבין את ההקשר ולבחור בעצמו פרוזודיה מתאימה בלי הנחיות ידניות.

בגרסה הזו קצב ייצור הטוקנים של מודל השפה ירד מ־12.5Hz ל־6.25Hz, מה שחותך את העומס החישובי, בזמן שקצב הדגימה של ה־VAE עלה ל־44.1kHz לעומת 16kHz בגרסה הקודמת. התוצאה בפועל היא תדרים גבוהים חדים יותר בשכפול קול בלי לפגוע בזמני הריצה. בנוסף, המערכת תומכת באימון המשך מלא וב־LoRA כדי להתאים קולות ספציפיים על גבי הדאטה שלכם.

מתאים ל

  • שכפול קול מהיר למשחקים

    מאפשר לייצר דיבוב דמויות באנגלית מתוך דגימת אודיו קצרה, באיכות 44.1kHz ועם התאמת אינטונציה להקשר.

  • קריינות לפודקאסטים וטקסטים

    קריאת טקסטים ארוכים באנגלית ובסינית בקצב דיבור שמשתנה אוטונומית לפי תוכן המשפט, ללא הגדרת פונמות ידנית.

  • בוטים קוליים בזמן אמת

    זמן הפקה מהיר של 0.17 על חומרה ביתית מאפשר הזרמת תשובות קוליות בדיאלוגים שוטפים באנגלית.

איפה זה נופל

המודל מוגבל אך ורק לאנגלית וסינית. עברית ושפות אחרות לא נתמכות, והזנה של טקסט בעברית תניב פלט משובש או בלתי שמיש. היציבות של המודל נוטה לרדת בטקסטים ארוכים במיוחד או בקטעים דרמטיים, שם הוא עלול להכניס ארטיפקטים או לאבד עקביות. בנוסף, אין שליטה ישירה מובנית על רגשות או סגנון דיבור דרך פרמטרים נפרדים, אלא רק דרך שינוי ה־CFG ודגימת הקול המקורית. אם מפעילים את מנגנון ניקוי הרעשים ZipEnhancer על דגימת הקול, איכות הפלט נחתכת אוטומטית מ־44.1kHz ל־16kHz בלבד.

שאלות
נפוצות

האם המודל תומך בהקראת טקסט בעברית?

לא. המודל אומן על אנגלית וסינית בלבד, והמפתחים מציינים במפורש שביצועים בשפות אחרות אינם מובטחים ויובילו לפלט באיכות נמוכה או לא צפויה. עבור פרויקטים שדורשים עברית הוא לא רלוונטי.

איך משפיעה הפעלת ניקוי הרעשים על איכות השמע?

הפעלת Prompt Speech Enhancement מנקה רעשי רקע מההקלטה שסיפקתם לשכפול, אך היא מגבילה את תדר הדגימה הסופי ל־16kHz. אם יש לכם הקלטת מקור נקייה, עדיף לכבות את הניקוי כדי להגיע לאיכות המלאה של 44.1kHz.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.8 גיגה בייט בלבד עם כ־802 מיליון פרמטרים. על כרטיס RTX 4090 הוא מציג מדד זמן אמת של 0.17 בסינתזת סטרימינג, כלומר הוא מייצר שעה של אודיו בכעשר דקות ומגיב מהר מאוד לקלטי משתמש. כרטיס מסך מודרני עם שמונה עד שנים עשר גיגה בייט של זיכרון יספיק כדי להרים אותו מקומית דרך ספריית voxcpm בפייתון או בממשק הווב המצורף.

הריצה המקומית הגיונית במיוחד כשחייבים פרטיות מלאה לקבצי הקול שמוזנים כדגימות שכפול, או כשרוצים לעשות כוונון עדין באמצעות LoRA לקול מותאם אישית. אם אין לכם גישה למעבד גרפי ייעודי ואתם צריכים תפוקה רק מדי פעם, עדיף להשתמש בממשקי ענן צד שלישי כי סביבת מעבד רגיל תהיה איטית מדי לשימוש שוטף.

pip install -U huggingface_hub
hf download openbmb/VoxCPM1.5

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0, שמתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית. יחד עם זאת, מפתחיו ממליצים להשתמש בו לצורכי מחקר ופיתוח בלבד ולא לשלב אותו במערכות ייצור מסחריות בלי בדיקות בטיחות קפדניות ומניעת שימוש לרעה בזיוף קולות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗