GPT
M

magpie_tts_multilingual_357m

קוד פתוח

nvidiaother2025-12-11

  • nemo
  • gguf
  • NeMo
  • TTS
  • PyTorch

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הקראה קולית ב־12 שפות עם חמישה דוברים מוגדרים מראש, שמפיקה אודיו של 22 קילוהרץ מתוך 364 מיליון פרמטרים בלבד.

  • 1.9 GBמשקל הקבצים
  • 7,446הורדות בחודש
  • 215לייקים

מה זה

המודל של אנבידיה מייצר דיבור מטקסט על בסיס ארכיטקטורת מקודד ומפענח מסוג טרנספורמר, עם שלב עידון מקומי שמפחית את אורך הרצף פי שניים כדי להאיץ את תהליך ההפקה. במקום לייצר גלי קול ישירות, הוא מייצר טוקנים של אודיו שעוברים פענוח דרך מודל נלווה בשם NanoCodec. כל חמשת הקולות מדברים בכל 12 השפות הנתמכות, שכוללות אנגלית, ערבית, ספרדית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית, הינדי, וייטנאמית וסינית.

הוא שונה ממודלים כבדים בכך שהוא מוותר לחלוטין על שכפול קול מקובץ שמע, ומציע במקום זה ביצועים יציבים עם תמיכה מובנית בתעתיק פונטי לפי IPA למילים מותאמות אישית. הגודל הקומפקטי שלו מתאים במיוחד להטמעה בצינורות תגובה של סוכני שיחה מבוססי שפה, שבהם זמן התגובה להשמעת האודיו הוא גורם קריטי.

מתאים ל

  • סוכני שירות קוליים

    חיבור ישיר למודל שפה גדול לקבלת הקראה מהירה בקול קבוע של דובר במגוון שפות בלי תלות בשיבוט.

  • הקראת ספרים וטקסט ארוך

    יצירת שמע רציף לקטעי טקסט ממושכים בזכות מנגנון חלון הזזה ששומר על איכות יציבה לכל אורך הקובץ.

  • דיבוב ולוקליזציה

    שמירה על זהות קולית של אותה דמות בדיוק במעבר בין תכנים בשפות שונות, כמו אנגלית, ספרדית וערבית.

איפה זה נופל

המודל הזה לא כולל יכולת שיבוט קול מחומר קיים. אנבידיה הסירו את האפשרות הזו מטעמי אבטחה, כך שאתם מוגבלים אך ורק לחמשת הקולות המובנים שמגיעים איתו. בנוסף, הוא לא תומך בעברית, ורשימת השפות מוגבלת בדיוק ל־12 השפות שאומנו, כך שלמוצר מקומי לישראל הוא פשוט לא רלוונטי כרגע.

לפני שמשלבים אותו במוצר, קחו בחשבון שהוא דורש נרמול טקסט מוקדם ועיבוד דרך מודל הקידוד הנלווה NanoCodec כדי לקבל גל קול אמיתי, מה שמוסיף עוד שלב בצינור העבודה ולא מייצר קובץ אודיו ישירות מהטרנספורמר הראשי.

שאלות
נפוצות

האם המודל תומך בהקראה בעברית?

לא. המודל אומן על 12 שפות ספציפיות בלבד, בהן אנגלית, ערבית, ספרדית וסינית. עברית אינה נכללת ברשימת השפות הנתמכות ולא תעבוד.

האם אפשר לתת לו דגימת שמע של 10 שניות כדי שיחקה קול של מישהו אחר?

לא, היכולת הזו אינה קיימת במודל. אנבידיה הסירו לחלוטין את אפשרות שיבוט הקול בגרסה הזו משיקולי אבטחה, ומותר להשתמש רק בחמשת הקולות המובנים.

האם אני חייב כרטיס גרפי של אנבידיה כדי להפעיל אותו?

בהרצה מקומית מלאה התוכנה של NeMo מותאמת ומואצת למעבדים גרפיים של החברה מארכיטקטורת Ampere ומעלה. אם אין לכם כרטיס מתאים, תוכלו להשתמש במימוש NeMo-Speech.cpp או לקרוא ישירות לשירות ה־API בענן שלהם.

איך מריצים

בפועל אפשר להריץ אותו בשלוש דרכים: דרך ספריית NeMo הרשמית בפייתון, דרך מנוע NeMo-Speech.cpp לקובצי GGUF על מכונה מקומית, או באמצעות פנייה לשירות NIM של אנבידיה בענן. החומרה הנתמכת רשמית כוללת מעבדים גרפיים של החברה מארכיטקטורת Ampere ומעלה, כמו A10, L4, A100 או H100, כאשר הקבצים שוקלים 1.9 גיגהבייט ולכן הם נכנסים בקלות לזיכרון של כרטיסים צנועים יחסית.

אם יש לכם שרת עם כרטיס של אנבידיה ואתם צריכים שליטה על שילוב מילונים מותאמים אישית וסדרת קולות קבועה, הרצה מקומית ב־NeMo או C++ היא פתרון מצוין. אם אתם רצים על סביבה בלי מעבד גרפי מתאים, או לא רוצים להחזיק תשתית פעילה בשביל עומסים משתנים, עדיף פשוט לתשאל את ה־API המנוהל של Riva בענן שלהם.

ollama run hf.co/nvidia/magpie_tts_multilingual_357m:F16

הרישיון

הרישיון הוא NVIDIA Open Model License שמתיר שימוש מסחרי ומחקר. אתם יכולים לשלב אותו במוצר שלכם, אבל כפופים להגבלות השימוש והתנאים המשפטיים הכלליים של אנבידיה שמופיעים בהסכם המקורי שלהם.

הרישיון המלא בעמוד המודל ↗