GPT
T

tada-3b-ml

קוד פתוח

HumeAIllama3.22026-02-16

  • safetensors
  • llama
  • tts
  • text-to-speech
  • speech-language-model

מודל דיבור רב לשוני שמסנכרן טוקן טקסט בודד לוקטור אודיו תואם. הוא מקצר את זמן העיבוד ביחס למודלי קול רגילים ומונע הזיות תמלול.

  • 4.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 8.3 GBמשקל הקבצים
  • 6,703הורדות בחודש

מה זה

הארכיטקטורה של tada-3b-ml בנויה מעל Llama 3.2 3B עם 4.2 מיליארד פרמטרים. במקום לייצר אודיו לפי קצב פריימים קבוע, למשל חמישים פריימים לשנייה כמו ברוב מודלי הדיבור, הוא עובד בשיטת התאמה של אחד לאחד בין טוקן טקסטואלי לווקטור קולי. כל צעד מייצר את מקטע האודיו המלא של המילה או חלקה, וקובע את משך הזמן והאינטונציה בזמן אמת.

המודל כולל תמיכה במספר שפות, כולל ערבית, יפנית, גרמנית, צרפתית, ספרדית, איטלקית ופורטוגזית, לצד אנגלית. המבנה שלו מיועד גם להקראת טקסט וגם להמשך דיבור וטקסט בו זמנית, תוך שימוש במקודד נפרד שמבצע התאמה כפויה בין הקול למילים.

מתאים ל

  • הקראת טקסט רב לשונית

    יצירת קולות דוברי ערבית, אנגלית או ספרדית מתוך טקסט כתוב בדיוק קולי גבוה.

  • שיבוט קול עם פרומפט קצר

    טעינת דגימת קול חיצונית וחיקוי גוון הדיבור לפי סגנון הדובר המקורי.

  • המשך שיחה בקול וטקסט

    ייצור המשך לשיחה קולית שבה המודל פולט במקביל את המילים הבאות ואת האודיו שלהן.

איפה זה נופל

החיסרון המרכזי הוא היעדר תמיכה בעברית ברשימת השפות של המקודד. בנוסף, מנגנון התמלול האוטומטי המובנה עובד אך ורק באנגלית. אם מזינים קול בשפה אחרת כמו ערבית או יפנית, חייבים לספק תמלול טקסטואלי מדויק של קטע האודיו באופן ידני. אם לא תעשו זאת, איכות ההתאמה תרד באופן משמעותי, והדיבור המופק עלול להישמע משובש ומקוטע.

שאלות
נפוצות

האם המודל תומך בהקראת טקסט בעברית?

לא. רשימת השפות הנתמכות כוללת אנגלית, יפנית, גרמנית, צרפתית, ספרדית, איטלקית, ערבית ופורטוגזית. עברית אינה מופיעה ברשימת המקודדים ולא נתמכת.

למה חובה להעביר תמלול יחד עם קובץ הקול בשפות זרות?

מנגנון זיהוי הדיבור של המקודד פועל באנגלית בלבד. כדי שהמודל יבצע סנכרון נכון בין הקול לטקסט בשפה כמו ערבית או צרפתית, צריך לספק לו את התמליל המדויק מראש.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 16GB זיכרון עבודה ייעודי, כי המודל עצמו שוקל 8.3GB ודורש הרצה לצד מקודד הקול בפורמט bfloat16. ההתקנה מתבצעת ישירות ממאגר הגיטהאב של Hume AI באמצעות pip, ויש לטעון את המודל דרך הקוד שלהם עם TadaForCausalLM.

אם אין לכם כרטיס מתאים עם תמיכת CUDA או שאתם מחפשים מענה מהיר בלי לנהל תלויות של קבצי קול ומודלים מרובי שפות, שימוש בשרת מנוהל חיצוני יהיה פשוט בהרבה מתחזוקת סביבת ההרצה הזו.

pip install -U huggingface_hub
hf download HumeAI/tada-3b-ml

הרישיון

המודל כפוף לרישיון הקהילתי של Meta עבור Llama 3.2. השימוש מותר למטרות מחקר ומסחר, אך מחייב קבלת אישור גישה מראש בעמוד הרשמי של מטא. אם המוצר שלכם עובר 700 מיליון משתמשים פעילים בחודש, תידרשו לבקש מהם רישיון מיוחד.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗