GPT
M

maya1

קוד פתוח

maya-researchapache-2.02025-10-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • text-to-speech

הפיכת טקסט לדיבור שמבוססת על מודל שפה של 3.3 מיליארד פרמטרים. השליטה בגוון הקול ובביטוי הרגשי נעשית ישירות דרך פרומפט ותגיות טקסטואליות, בלי צורך בקובץ שמע לדוגמה.

  • 3.3Bפרמטרים
  • 131,072טוקנים בהקשר
  • 6.2 GBמשקל הקבצים
  • 9,120הורדות בחודש

מה זה

במקום להסתמך על מודל קול ייעודי מסורתי, החוקרים לקחו ארכיטקטורת Llama רגילה ואימנו אותה לחזות טוקנים של מקודד האודיו העצבי SNAC. הקלט הוא תיאור מילולי חופשי של הדמות בסגנון XML לצד הטקסט המבוקש, והפלט הוא אודיו מונו באיכות 24kHz. היתרון כאן הוא השליטה הדקה בהגייה, כולל תגיות רגש מוטמעות כמו צחוק, לחישה או בכי שמשפיעות על הרצף בדיוק בנקודה שבה שתלתם אותן.

ההבדל המשמעותי מול רוב הכלים הקיימים בגודל הזה הוא היכולת לייצר אופי קולי מאפס באמצעות טקסט בלבד, בלי לספק דגימת קול מקדימה לשיבוט ובלי להסתפק ברשימת קולות קבועה מראש. ההסבה של מודל שפה לעבודה מול מקודד אודיו היררכי מאפשרת לו לשמור על רציפות הגיונית בדיבור לאורך פסקאות ארוכות.

מתאים ל

  • סוכני שירות קוליים

    שילוב הזרמה בזמן אמת עם תגובות מהירות והבעת רגש שמתאימה לטון של הלקוח.

  • דיבוב דמויות במשחקים

    הפקת קולות אופי מגוונים ומוזרים על בסיס תיאור טקסטואלי בלבד וללא שחקני קול.

  • הקראת ספרים ופודקאסטים

    שמירה על גוון קול יציב לאורך זמן עם יכולת לשלב שינויי רגש לאורך העלילה.

איפה זה נופל

המודל מוגבל לאנגלית בלבד, כך שלמוצרים בעברית אין מה לחפש כאן בשלב זה. מעבר למגבלת השפה, האיכות מגיעה ל־24kHz במונו בלבד, שזה מספיק לשיחה שוטפת או לבוטים, אבל נמוך מהסטנדרט הנדרש להפקות סאונד מקצועיות או דיבוב ברמת אולפן. תגיות הרגש עובדות מצוין בדוגמאות, אך מחייבות בדיקה ידנית כדי לוודא שהמודל לא מפרש אותן לא נכון בטקסטים מורכבים.

שאלות
נפוצות

האם אפשר לשבט קול קיים באמצעות קובץ שמע?

לא, המודל אינו תומך בהזנת דגימות אודיו לצורך שיבוט קול. יצירת הקולות מתבצעת כולה דרך תיאור מילולי בלבד בפרומפט, כך שכדי להתקרב לקול מסוים תצטרכו להגדיר את מאפייניו במילים.

איך המודל מתמודד עם עברית?

כרגע המודל אומן על אנגלית בלבד עם תמיכה במבטאים שונים, ואינו מסוגל להקריא טקסט בעברית. אם תזינו מילים בעברית הפלט ישתבש או ייכשל לחלוטין.

האם נדרשת חומרה מיוחדת כדי לקבל הזרמה חיה?

כרטיס מסך מודרני בודד בעל 16 גיגה זיכרון מספיק להרצה מלאה. כדי להגיע לשיהוי נמוך מתחת למאה מילישניות יש להשתמש במנוע vLLM ובסקריפט ההזרמה המצורף למודל.

איך מריצים

המשקל הכולל של הקבצים עומד על 6.2 גיגה בייט, מה שאומר שכרטיס מסך בודד עם 16 גיגה בייט זיכרון דוגמת RTX 4090 יספיק כדי להריץ אותו מקומית. כדי לקבל זמני תגובה נמוכים של פחות ממאה מילישניות, המפתחים מספקים סקריפט ייעודי שמריץ את המודל מעל vLLM ומנצל מנגנון של מטמון קידומות אוטומטי לחלק של תיאור הקול.

אם אתם לא צריכים שיהוי נמוך להזרמה חיה או שאין לכם חומרה ייעודית שתעבוד ברצף, עדיף להשתמש ב־API חיצוני של שירותי קול קיימים. הרצה עצמית כאן משתלמת בעיקר כשבונים סוכן קולי שחייב להגיב בזמן אמת, או כשרוצים לחסוך עלויות שימוש פר שנייה בקנה מידה רחב.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="maya-research/maya1")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקולות, להריץ אותו בענן פרטי או להטמיע אותו בתוך מוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗