GPT
T

tada-1b

קוד פתוח

HumeAIllama3.22026-01-12

  • safetensors
  • llama
  • tts
  • text-to-speech
  • speech-language-model

מודל דיבור שמתאים כל טוקן טקסט ישירות לווקטור שמע יחיד, במקום לעבוד בקצב פריימים קבוע. הוא מבוסס על Llama 3.2 ומייצר דיבור טבעי ויציב בהרבה פחות חישובים.

  • 2.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 3.7 GBמשקל הקבצים
  • 7,576הורדות בחודש

מה זה

הארכיטקטורה של HumeAI מציגה שיטה שונה מרוב מודלי הדיבור הקיימים. במקום לחשב עשרות פריימים של אודיו לכל שנייה, היא מייצרת את כל מקטע השמע עבור טוקן טקסט בצעד אוטורגרסיבי בודד. ההתאמה הזו, ביחס של אחד לאחד, מאפשרת למודל לקבוע את משך ההגייה והאינטונציה בזמן אמת בלי להיגרר להזיות של מילים שלא מופיעות בטקסט.

המודל מגיע עם 2.2 מיליארד פרמטרים וחלון הקשר רחב של 131,072 טוקנים, מה שמאפשר לו להחזיק שיחות ארוכות או קטעי קריאה מורכבים. מעבר להקראת טקסט רגילה, הוא יודע לעבוד כמודל שפה ודיבור משולב, שבו הוא חוזה את הטוקן הבא בטקסט ובמקביל פולט את גל הקול של הטוקן הקודם.

מתאים ל

  • הקראת טקסט בזמן אמת

    הסנכרון של צעד אחד לטוקן חוסך משאבי חישוב ומאפשר להפיק שמע מהר יותר ממודלי TTS רגילים.

  • המשך דיבור וטקסט רציף

    היכולת לייצר טקסט ואודיו במקביל מתאימה ליצירת סוכני שיחה שמגיבים ישירות בקול.

  • שיבוט קול לפי דגימה

    המערכת מקבלת דגימת קול קצרה וטקסט תואם כדי לחקות את גוון הדיבור עבור טקסט חדש לחלוטין.

איפה זה נופל

המודל מאומן כרגע על השפה האנגלית בלבד, כך שהוא לא מתאים לפרויקטים שדורשים עברית. בנוסף, הוא דורש טעינה נפרדת של מודל קידוד חיצוני לצורך יצירת הפרומפטים הקוליים. למרות שהכרטיס מציג גרפים של דיוק, מהירות וטבעיות, הנתונים המספריים המדויקים של המדדים האלה לא פורסמו שם ישירות, ולכן חייבים לבדוק את התנהגות הקול והפרוזודיה על המקרים שלכם לפני שמתחייבים אליו.

שאלות
נפוצות

האם המודל תומך בהקראת עברית?

לא. המודל מאומן ומיועד לשפה האנגלית בלבד, ואינו כולל תמיכה מובנית בשפות אחרות.

האם אפשר להריץ אותו ישירות מספריית transformers של Hugging Face?

הקוד דורש התקנה של החבילה הייעודית מהגיטהאב של HumeAI, כיוון שהוא משתמש במחלקות ייעודיות לארכיטקטורה ולמקודד הקול.

איך מריצים

כדי להריץ אותו מקומית צריך כרטיס מסך עם תמיכה ב־CUDA. גודל הקבצים עומד על 3.7 גיגה בייט, כך שכרטיס מסך מודרני פשוט עם 8 או 12 גיגה זיכרון יספיק לגמרי לטעינת המשקלים יחד עם מקודד השמע הייעודי שלו.

ההתקנה מתבצעת ישירות ממאגר הגיטהאב של הפרויקט באמצעות pip. אם אתם צריכים איכות קול עמוקה יותר, יש גם גרסת 3B גדולה יותר, אבל למי שרק צריך הקראת טקסט בסיסית ביישום קצה בלי לנהל תשתית שרתים, פנייה לשירות ענן מוכן תחסוך את כאב הראש של ניהול חומרת GPU.

pip install -U huggingface_hub
hf download HumeAI/tada-1b

הרישיון

הרישיון הוא רישיון הקהילה של Llama 3.2. הוא מתיר שימוש מסחרי ומחקר חופשי לרוב הפרויקטים, אך מטיל מגבלות אם המוצר שלכם עובר 700 מיליון משתמשים חודשיים פעילים, ודורש שמירה על תנאי השימוש המקוריים של חברת מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗