GPT
V

Veena

קוד פתוח

maya-researchapache-2.02025-06-24

  • transformers
  • safetensors
  • llama
  • text-generation
  • text-to-speech

מודל המרת טקסט לדיבור מבוסס Llama שמייצר קול בהינדית ובאנגלית. הוא מציע ארבעה קולות מובנים, זמן תגובה מהיר יחסית, ופונה למי שצריך תמיכה ייעודית בשילוב שפות הודיות.

  • 3.8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 7.1 GBמשקל הקבצים
  • 14,356הורדות בחודש

מה זה

מדובר במודל שמייצר אודיו ישירות מטקסט בעזרת מקודד SNAC בקצב דגימה של 24kHz. הארכיטקטורה יושבת על בסיס של 3.8 מיליארד פרמטרים מבית Llama, כשההתמחות העיקרית שלו היא התמודדות עם הינדית, אנגלית וערבוב בין השתיים באותו המשפט, מה שמכונה code-mixed. הוא אומן בעזרת LoRA על בסיס הקלטות אולפן של ארבעה קריינים מקצועיים בלבד, ומאפשר לבחור את הדובר באמצעות טוקן ייעודי בתחילת הקלט.

בבדיקות הביצועים של היוצרים הוא מציג ציון איכות קול ממוצע של 4.2 מתוך 5 ומדד מובנות של 98 אחוזים. המשמעות בשטח היא שהדיבור ברור להבנה ואינו נשמע מקוטע, אך הוא מוגבל לסגנון הדיבור של אותם ארבעה קריינים ספציפיים שהוקלטו מראש.

מתאים ל

  • מענה קולי במוקדים

    זמני תגובה של 80 עד 120 מילישניות במאיצים מתאימים, יחד עם תמיכה בשילוב הינדית ואנגלית בשיחה.

  • הקראת תוכן דיגיטלי

    פלט אודיו בקצב 24kHz שמתאים לפודקאסטים, חומרי לימוד או ספרים מוקלטים בשפות הנתמכות.

  • הנגשת ממשקים לרכב

    יצירת הנחיות קוליות ומערכות ניווט עבור שווקים הדוברים הינדית ואנגלית עם ארבעה קולות שונים.

איפה זה נופל

החיסרון המרכזי הוא היעדר מוחלט של תמיכה בשפות אחרות. אין כאן עברית כלל, והוא מוגבל אך ורק להינדית ולאנגלית. מעבר לכך, המבחר מצומצם בדיוק לארבעה קולות מוגדרים מראש, כך שאי אפשר לשכפל קולות חדשים או לשנות סגנון ומבטאים אזוריים מעבר למה שהוקלט.

נקודה קריטית נוספת היא אורך הקלט. למרות שבמטא־דאטה רשום חלון גדול בהרבה, הכרטיס הטכני מציין במפורש מגבלת קלט של 2048 טוקנים בלבד. מעבר לזה, אין כרגע תמיכה בהזרמת אודיו בזמן אמת, והנתונים שעליהם אומן שמורים ואינם פתוחים לבדיקה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בשביל להקריא טקסט בעברית?

לא. המודל אומן באופן בלעדי על אנגלית והינדית, ואין לו יכולת להגות עברית. שימוש בטקסט בעברית לא יעבוד ולא יפיק דיבור ברור.

כמה זיכרון כרטיס מסך נדרש כדי להריץ אותו בפועל?

במשקל מלא של 7.1 גיגה בייט בדיוק bfloat16 תצטרכו כרטיס מסך של לפחות 16 עד 24 גיגה בייט זיכרון. שימוש בקוונטיזציה של 4 ביט דרך bitsandbytes יכול להוריד את צריכת הזיכרון, אך עדיין דורש GPU כדי לשמור על קצב הפקה הגיוני.

האם המודל תומך בהזרמת אודיו תוך כדי יצירה?

לא בגרסה הזו. היכולת להזרים את האודיו בזמן אמת מוגדרת בעמוד הפרויקט כתכונה עתידית שנמצאת בפיתוח, כך שכרגע צריך לחכות לסיום יצירת הקובץ.

איך מריצים

כדי להריץ אותו צריך התקנה של ספריות transformers, torch, torchaudio, snac וספריית bitsandbytes לצורך קוונטיזציה. הקבצים שוקלים 7.1 גיגה בייט בדיוק bfloat16, אך כדי לקבל זמני תגובה שמתאימים למוצר חי נדרש כרטיס מסך חזק. על גבי חומרת H100 המודל מגיע להשהיה של פחות מ־80 מילישניות, על גבי A100 זה עולה לסביבות 120 מילישניות, ועל כרטיס שולחני כמו RTX 4090 מדובר על כ־200 מילישניות.

הוא תומך בקוונטיזציה של 4 ביט כדי לחסוך בזיכרון, אבל ריצה על מעבד רגיל תהיה איטית משמעותית. אם אין לכם גישה לכרטיסי מסך ייעודיים בשרת, המודל הזה כבד מדי להרצה עצמאית ועדיף לפנות לשירותי ענן.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="maya-research/Veena")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש של המערכת כחלק ממוצר שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗