GPT
D

Dia-1.6B

קוד פתוח

nari-labsapache-2.02025-04-20

  • safetensors
  • model_hub_mixin
  • pytorch_model_hub_mixin
  • text-to-speech
  • en

הוא מייצר דיאלוגים שלמים ישירות מתמלול טקסט, כולל שתי דמויות, צחוק ושיעול. זה מודל קול פתוח שמתאים למי שרוצה שיחה טבעית מקובץ טקסט יחיד.

  • 1.6Bפרמטרים
  • 12.0 GBמשקל הקבצים
  • 29,464הורדות בחודש
  • 2,908לייקים

מה זה

המודל פותח על ידי Nari Labs כדי לייצר דיבור שלם מתוך תסריט. במקום להקליט כל דובר בנפרד ולחבר אותם ידנית, הוא מבין תגיות של דובר ראשון ודובר שני ומפיק את השיחה ברצף. הוא מסוגל לשלב אלמנטים לא קוליים כמו צחקוקים, אנחות, כחכוך בגרון ומחיאות כפיים ישירות מתוך הטקסט, ותומך גם בשכפול קול לפי דגימת שמע.

בגודל של 1.6 מיליארד פרמטרים, הוא תופס 12 גיגה בייט של קבצים ומיועד כרגע לשפה האנגלית בלבד. בכרטיס המודל מוצגת השוואה לכלים כמו ElevenLabs Studio ו־Sesame CSM-1B. הוא לא מאומן על קול ספציפי אחד, ולכן ברירת המחדל שלו היא להחליף קולות בכל הרצה, אלא אם כן מקבעים סיד או מזינים פרומפט שמע שמגדיר את זהות הדובר.

מתאים ל

  • הפקת פודקאסטים אוטומטית

    יצירת שיחה רציפה בין שתי דמויות ישירות מתסריט אנגלי מוכן, כולל תגובות טבעיות וצחוק הדדי.

  • דיבוב דמויות למשחקים

    הפקת דיאלוגים באנגלית עם רגש ושכפול קולות על פי דגימת אודיו קצרה בלי לחתוך קבצים ידנית.

  • מחקר ופיתוח דיבור בקוד פתוח

    בדיקת ארכיטקטורות טקסט לדיבור מבוססות קודקים קוליים על גבי תשתית פייתורץ' נגישה.

איפה זה נופל

החיסרון המרכזי למפתחים ישראלים הוא היעדר תמיכה בעברית. המודל מוגדר ומאומן לאנגלית בלבד, ואי אפשר להשתמש בו לטקסט מקומי. בנוסף, חוסר העקביות בקולות מחייב עבודה עם פרומפט אודיו כדי למנוע החלפת קול אקראית בכל הפעלה.

גם תגיות הקולות הלא מילוליים, כמו צחוק, גניחות או צעקות, מוגדרות על ידי המפתחים ככאלה שעלולות לגרום לפלט לא צפוי. המודל עדיין לא מגיע בגרסה מכווצת, אין לו כרגע תמיכה רשמית בדוקר, ואין יכולת להריץ אותו בלי מעבד גרפי מתאים.

שאלות
נפוצות

האם אפשר להריץ את המודל על מקבוק או מחשב בלי כרטיס מסך ייעודי?

לא כרגע. המודל נבדק ונתמך אך ורק על גבי מעבדים גרפיים עם סביבת CUDA 12.6 ומעלה. תמיכה במעבדים רגילים מתוכננת לגרסאות הבאות אבל עדיין לא קיימת, וכך גם גרסאות מכווצות שדורשות פחות משאבים.

למה הקול של הדובר משתנה בין הרצות שונות של אותו הטקסט?

המודל לא אומן מראש על קול יחיד קבוע. כדי לקבל את אותו הקול בכל פעם, צריך להזין דגימת שמע שתשמש כבסיס לשכפול, או לקבע את מספר הזרע בקוד ההרצה.

האם המודל יודע לדבר עברית?

לא. המודל תומך כרגע אך ורק בשפה האנגלית, וכל ניסיון להזין טקסט בעברית לא יעבוד בצורה תקינה.

איך מריצים

כדי להריץ אותו מקומית חייבים כרטיס מסך של אנבידיה עם CUDA 12.6 וגרסת פייתורץ' 2.0 ומעלה. נכון לעכשיו המודל לא תומך בריצה על מעבד רגיל, ודורש לפחות 10 גיגה בייט של זיכרון גרפי פנוי. בריצה הראשונה הוא מוריד רכיב נוסף של Descript Audio Codec, ולכן ההפעלה הראשונית ארוכה יותר מהרגיל.

מבחינת ביצועים, על כרטיס A4000 הוא מייצר בערך 40 טוקנים בשנייה, כאשר שנייה אחת של אודיו דורשת 86 טוקנים. זה אומר שעל חומרה ברמה הזו הוא מייצר בקצב שהוא בערך חצי ממהירות הדיבור בפועל, ולא בזמן אמת. אם יש לכם כרטיסים ארגוניים חזקים יותר תוכלו להגיע לקצב זמן אמת, במיוחד עם הפעלת torch.compile, אבל למחשב פיתוח רגיל בלי כרטיס מסך חזק עדיף להשתמש במרחב הניסיוני שלהם ברשת.

pip install -U huggingface_hub
hf download nari-labs/Dia-1.6B

הקבצים

6 קבצים במאגר, 12.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט משוחרר תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והפצה חופשית, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון. בדף המודל המפתחים מוסיפים איסור על התחזות לאנשים ללא רשות, הפצת מידע כוזב או שימוש מזיק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗