GPT
L

Llasa-1B

קוד פתוח

HKUSTAudiocc-by-nc-4.02025-01-07

  • safetensors
  • llama
  • Text-to-Speech
  • text-to-speech
  • zh

הופך טקסט לדיבור באנגלית ובסינית על גבי ארכיטקטורת שפה מוכרת. הוא מתאים למי שמחפש מודל קל יחסית שמייצר אודיו גם מטקסט בלבד וגם מדגימת קול נתונה.

  • 1.4Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.6 GBמשקל הקבצים
  • 547הורדות בחודש

מה זה

מדובר במודל שמיישם ארכיטקטורת LLaMA רגילה כדי לייצר דיבור. במקום לעבוד עם אסימוני טקסט בלבד, הוא מחבר אותם לאוצר מילים של 65,536 אסימוני קול מתוך XCodec2. הוא אומן על 250,000 שעות הקלטה באנגלית ובסינית, ויודע לקחת טקסט פשוט ולהוציא ממנו קול, או לקבל דגימת אודיו קצרה כהנחיה ולחקות את הדיבור שלה.

בניגוד למודלי דיבור ישנים שנשענו על רכיבים מפוצלים ומסורבלים, כאן כל תהליך ההפקה מתנהג כמו מודל שפה שמנחש את הטוקן הבא. הגישה הזו נשענת על אותם עקרונות אימון של מודלי טקסט גדולים, ומאפשרת לשלוט בדיוק ובאופי הפלט באמצעות דגימה סטנדרטית.

מתאים ל

  • מחקר בתחום האודיו

    הוא מציע בסיס קוד פתוח עם הוראות כוונון עדין למחקר של שילוב אסימוני קול במודלי שפה.

  • חיקוי קול באנגלית

    היכולת לקבל פרומפט קולי מאפשרת לייצר הקראת טקסט מותאמת אישית מתוך דגימת מקור קצרה.

  • הקראה לוקאלית על מחשב אישי

    בזכות משקל של 2.6 גיגה הוא רץ ישירות על חומרה מקומית צנועה ללא תלות ברשת.

איפה זה נופל

הוא תומך רק באנגלית ובסינית. אין בו שום תמיכה מובנית בעברית, כך שניסיון להקריא טקסט ישראלי יסתיים בג'יבריש מוחלט. בנוסף, מדובר במודל יוצר שמבוסס על הסתברות, והיוצרים מציינים בעצמם שצריך לשחק עם ערכי הטמפרטורה והדגימה כדי שהפלט יהיה יציב ולא יישבר. הוא גם תלוי לחלוטין ברכיב חיצוני כדי להפוך את הפלט לשמע אמיתי.

אותה משפחה

Llasa יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו להקראת טקסטים בעברית?

לא. המודל אומן באופן בלעדי על 250,000 שעות של אנגלית וסינית. הוא לא מזהה אותיות עבריות ולא יודע להפיק את הצלילים המתאימים.

האם הוא מספיק כדי להשמיע קובץ סאונד ישירות?

לא לבד. הוא מייצר אסימוני קול של מודל שפה, וכדי להפוך אותם לקובץ שמע שניתן להאזין לו חובה להתקין ולהריץ גם את XCodec2.

איך מריצים

במשקל של 2.6 גיגה-בייט ובדיוק bfloat16, הוא נכנס בקלות לכל כרטיס מסך ביתי מודרני עם 6 או 8 גיגה זיכרון. כדי להשתמש בו באמת, חייבים להתקין גם את חבילת XCodec2, שמתרגמת את הטוקנים חזרה לגלי קול בפועל.

היוצרים ממליצים להריץ דגימה עם top_p של 0.95 וטמפרטורה של 0.9 כדי לקבל תוצאות יציבות. אם אתם צריכים רק שירות הקראה פשוט בלי שליטה על הקול ובלי ניהול תשתית מקומית, עדיף להשתמש ב־API מוכן במקום להסתבך עם התקנת הספריות והרצת מודל שפה שמייצר אודיו.

pip install -U huggingface_hub
hf download HKUSTAudio/Llasa-1B

הרישיון

הרישיון הוא CC BY-NC 4.0, כלומר השימוש מוגבל אך ורק למטרות מחקר, בדיקה ושימוש פרטי שאינו מסחרי. אסור לשלב אותו באפליקציה בתשלום, באתר מסחרי או במוצר שמייצר הכנסות. הפרת התנאים חושפת אתכם לצעדים משפטיים ישירים מצד היוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗