GPT
L

Llasa-3B

קוד פתוח

HKUSTAudiocc-by-nc-4.02025-01-07

  • safetensors
  • llama
  • Text-to-Speech
  • text-to-speech
  • zh

מודל המרת טקסט לדיבור שמבוסס ישירות על ארכיטקטורת LLaMA ומייצר אודיו בעזרת טוקנים ייעודיים. הוא מתאים למי שרוצה לסנתז קול או לשבט דיבור באנגלית וסינית על תשתית מוכרת של מודלי שפה.

  • 4Bפרמטרים
  • 131,072טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 600הורדות בחודש

מה זה

הפיתוח הזה לוקח את LLaMA והופך אותו למנוע דיבור מלא. במקום ארכיטקטורות קוליות נפרדות, הוא משתמש במילון קולי של 65,536 טוקנים מתוך XCodec2 ומתייחס לסאונד בדיוק כמו לטקסט רגיל. האימון שלו נשען על 250,000 שעות הקלטה בשפות סינית ואנגלית בלבד.

בפועל הוא יודע לייצר דיבור מטקסט נקי, או לחקות קול קיים אם מזינים לו דגימת אודיו קצרה כהנחיה. העובדה שהוא בנוי כמודל שפה רגיל אומרת שכל הכלים הקיימים לאופטימיזציה, האצה ואימון של מודלי LLaMA עובדים עליו בלי צורך בהתאמות מיוחדות.

מתאים ל

  • שיבוט קול באנגלית

    יצירת דיבור בקול מותאם אישית מתוך דגימת שמע קצרה, הודות לתמיכה של המודל בשימוש בקובץ קול כפרומפט.

  • מחקר על מודלי קול מבוססי שפה

    בדיקת שיטות דחיסה, כוונון עדין והאצה שמגיעות מעולם ה־LLM ישירות על גבי מודל שמייצר סאונד.

  • הקראת טקסטים בסינית

    סינתוז דיבור מתוך כמויות טקסט גדולות בזכות אימון רחב היקף של מאות אלפי שעות בשפה הסינית.

איפה זה נופל

הוא תומך אך ורק באנגלית ובסינית, כך שעברית לא באה בחשבון בלי אימון ייעודי מאפס. כדי להוציא ממנו אודיו תקין חייבים להתקין רכיב חיצוני נפרד בשם XCodec2, והיוצרים בעצמם מודים שלפעמים יש חוסר יציבות בהפקה וממליצים על פרמטרי דגימה ספציפיים כדי לעקוף את זה.

אותה משפחה

Llasa יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו כדי להקריא טקסטים בעברית?

לא. המודל אומן על 250,000 שעות של שמע באנגלית ובסינית בלבד, והוא לא כולל תמיכה בעברית. ניסיון להזין לו עברית יניב ג'יבריש או שגיאות.

האם אפשר להריץ אותו ישירות מתוך ספריית transformers בלי תוספות?

לא באופן מלא. המודל עצמו נשען על ארכיטקטורת LLaMA, אבל כדי לפענח את הטוקנים של הסאונד לאודיו אמיתי שניתן להאזנה חובה להתקין את ספריית XCodec2.

איך מריצים

המשקלים תופסים 7.5 גיגה בייט בדיוק bfloat16 ומכילים ארבעה מיליארד פרמטרים בפועל. בשביל להריץ אותו מקומית תצטרכו כרטיס מסך עם לפחות 12 עד 16 גיגה בייט של זיכרון גרפי, יחד עם התקנה מקדימה של חבילת XCodec2 שמפענחת את הטוקנים חזרה לגלי קול.

המפתחים מעדכנים שכדי לקבל תוצאות יציבות בזמן הדגימה, מומלץ להגדיר טמפרטורה של 0.9 וערך top_p של 0.95. אם אין לכם חומרה ייעודית שתחזיק יצירת טוקנים רציפה או שאתם לא צריכים שליטה ישירה במשקלים ובשיבוט, שירות מנוהל חיצוני יחסוך את כאב הראש של הקינפוג.

pip install -U huggingface_hub
hf download HKUSTAudio/Llasa-3B

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שאסור להשתמש בו לצרכים מסחריים בשום צורה. השימוש מוגבל למחקר, פיתוח פנימי והתנסות אישית, והמפתחים מזהירים במפורש מפני צעדים משפטיים במקרה של הפרה. אם התוכנית היא להכניס אותו למוצר מניב, תצטרכו לחפש פתרון אחר.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗