GPT
V

VoxCPM2

קוד פתוח

openbmbapache-2.02026-04-03

  • voxcpm
  • safetensors
  • text-to-speech
  • tts
  • multilingual

מודל דיבור פתוח של 2.3 מיליארד פרמטרים שמייצר אודיו באיכות 48 קילוהרץ מתוך טקסט. הוא יודע לעצב קול לפי תיאור מילולי ולשכפל קולות קיימים ישירות מקבצי אודיו קצרים.

  • 2.3Bפרמטרים
  • 4.6 GBמשקל הקבצים
  • 410,797הורדות בחודש
  • 1,595לייקים

מה זה

בבסיס שלו יושבת ארכיטקטורת MiniCPM 4 בשילוב מודל דיפוזיה אוטורגרסיבי, ללא טוקנייזר אודיו מסורתי. הוא אומן על מעל שני מיליון שעות דיבור וכולל רכיב AudioVAE מובנה שמקבל דגימות ברזולוציה נמוכה ומוציא סאונד סופי בחדות של 48 קילוהרץ בלי צורך בכלי שיפור חיצוני.

הייחוד כאן הוא השליטה הקולית. אפשר לתת לו הנחיה בסוגריים כמו אישה צעירה בקול עדין והוא ממציא קול מאפס, או להזין הקלטה של דובר קיים עם תיאור רגש כדי לשנות את הטמפו והאינטונציה תוך שמירה על גוון הקול. המודל תומך בשלושים שפות, כולל עברית, ללא צורך בתיוג מוקדם של שפת הקלט.

מתאים ל

  • שכפול קול לפודקאסטים

    שחזור גוון דיבור מקובץ קצר עם אפשרות לתקן אינטונציה ומהירות בלי להקליט מחדש באולפן.

  • דיבוב דמויות מונפשות

    יצירת קולות חדשים מאפס על בסיס הנחיות טקסט של גיל, רגש וטון דיבור ישירות מתוך התסריט.

  • הקראת ממשקים בזמן אמת

    הזרמת מקטעי קול מהירה שמאפשרת להקריא תגובות מערכת תוך כדי יצירה עם השהיה נמוכה.

איפה זה נופל

שליטה בקול ועיצוב קולות חדשים סובלים מחוסר עקביות בין ריצות. התיעוד מודה בפירוש שלעיתים קרובות צריך לייצר את אותו קטע פעמיים או שלוש עד שמקבלים את התוצאה המבוקשת.

בנוסף, איכות הפלט אינה אחידה בין שלושים השפות ותלויה בכמות המידע שהייתה באימון, כך שעברית דורשת בדיקת איכות קפדנית לפני שילוב במוצר. קטעי טקסט ארוכים מאוד או כאלה שמבקשים רמת הבעה רגשית גבוהה עלולים להוביל לחוסר יציבות בצליל.

שאלות
נפוצות

האם צריך כרטיס מסך יקר בשביל להריץ אותו בסביבת פיתוח?

מספיק כרטיס עם שמונה גיגהבייט זיכרון כדי להעלות את המודל בפורמט bfloat16. כדי לקבל זמני תגובה טובים ביצירה רציפה מומלץ כרטיס חזק כמו RTX 4090 שתומך בהאצות ייעודיות.

איך מכוונים את אופי הדיבור בלי לאמן את המודל מחדש?

מוסיפים הנחיה טקסטואלית בסוגריים בתחילת המחרוזת שנשלחת ליצירה. אפשר לציין מאפיינים כמו קצב דיבור מהיר, מצב רוח שמח או גיל, והוא מחיל אותם על האודיו המופק.

איך מריצים

כדי להריץ אותו מקומית צריך שמונה גיגהבייט זיכרון בכרטיס מסך, פייתון 3.10 ומעלה, PyTorch 2.5 וקודה 12. ההתקנה מתבצעת ישירות דרך מנהל החבילות עם פקודת pip עבור ספריית voxcpm, כשהמשקלים שוקלים 4.6 גיגהבייט בסך הכול.

על כרטיס מדגם RTX 4090 הוא מגיע לזמן יצירה ביחס של 0.3 מול זמן הדיבור, או 0.13 כשמשתמשים בהאצה של Nano vLLM. אם אין לכם חומרה ייעודית עם כרטיס אנבידיה מודרני, התקורה של ניהול שרת והשהיות ברינדור ארוך תהיה מורגשת ועדיף לשקול שירות ענן מנוהל.

pip install -U huggingface_hub
hf download openbmb/VoxCPM2

הרישיון

רישיון אפאצ'י 2.0 מלא ומתירני. מותר להשתמש במודל לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והטקסט של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗