GPT
D

Dia-1.6B-0626

קוד פתוח

nari-labsapache-2.02025-06-26

  • pytorch
  • safetensors
  • dia
  • model_hub_mixin
  • pytorch_model_hub_mixin

מודל פתוח שמייצר שיחות שלמות באנגלית בין שני דוברים מתוך טקסט אחד. הוא משלב צחוק, שיעול וצלילים אנושיים אחרים בלי לעבור בכלי עריכה חיצוניים.

  • 1.6Bפרמטרים
  • 18.0 GBמשקל הקבצים
  • 13,651הורדות בחודש
  • 134לייקים

מה זה

המודל הזה לוקח תסריט כתוב ומפיק ממנו קובץ אודיו ישיר שבו שני דוברים מדברים ביניהם, באמצעות תגיות פשוטות של דובר ראשון ושני. מעבר להקראת מילים רגילה, הוא מזהה בסוגריים פעולות קוליות כמו אנחות, גיהוקים, מחיאות כפיים או צחוק, ומשלב אותן בתוך הדיבור עצמו. בנוסף, יש לו יכולת שיבוט קול על בסיס קובץ שמע קצר שמצרפים כקלט, מה שמאפשר להשפיע על הטון והרגש בהקלטה.

בניגוד למנועי דיבור בסיסיים שמקריאים משפט בודד בקול אחיד ודורשים חיבור ידני של כמה קבצים כדי לבנות דיאלוג, כאן כל הדיאלוג נוצר במעבר אחד. הוא תומך כרגע באנגלית בלבד. המפתחים משווים את האיכות לכלים כמו אילבן לאבס או הדגם של סזמי, כשהיתרון המרכזי כאן הוא שמדובר במשקלים פתוחים שרצים אצלכם.

מתאים ל

  • הפקת פודקאסטים אוטומטית

    יצירת שיחה רציפה וטבעית באנגלית בין שני מנחים מתוך טקסט כתוב, כולל הפסקות וצחוקים.

  • דיבוב דמויות למשחקים

    הפקת אודיו באנגלית עם שיבוט קולות ושליטה ברגשות ללא צורך בהקלטות אולפן יקרות.

  • יצירת סימולציות שירות

    הדמיית שיחות קוליות מורכבות בין מוקדן ללקוח עבור תוכנות אימון עובדים.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא חוסר תמיכה מוחלט בעברית, המודל מדבר אנגלית בלבד. בנוסף, הוא לא אומן מראש על קולות ספציפיים ולכן בלי קלט שמע חיצוני או קיבוע של הסיד, תקבלו קולות שונים לחלוטין בכל הרצה. החוקרים גם מודים במפורש שתגיות הצלילים הלא מילוליים, מעבר לצחוק או שיעול פשוטים, עלולות לגרום לפלטים לא צפויים ולשבור את האודיו.

שאלות
נפוצות

האם אפשר להריץ אותו על המחשב הנייד ללא כרטיס מסך ייעודי?

לא. המודל נבדק ונתמך כרגע אך ורק על גבי מעבדים גרפיים עם קיודה ופאיטורץ'. תמיכה במעבדי מחשב רגילים טרם נוספה לפרויקט.

האם הוא מסוגל לדבר בעברית?

לא, המודל מוגבל כרגע לשפה האנגלית בלבד. כל ניסיון להזין לו טקסט בעברית לא יעבוד כמצופה.

איך שומרים על קול אחיד של הדוברים בין ריצות שונות?

מכיוון שהמודל לא עבר התאמה לקול בודד, צריך לספק לו דגימת שמע לשיבוט בכל פעם מחדש, או לקבע את מספר הסיד בקוד כדי למנוע החלפת קול אקראית.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של אנבידיה עם תמיכה בקיודה 12.6 ופאיטורץ' 2 ומעלה, כשהזיכרון הגרפי הנדרש עומד על כעשרה ג'יגה בייט. בריצה ראשונה נדרשת גם הורדה אוטומטית של קודק האודיו של דסקריפט. מעבדים רגילים עדיין לא נתמכים בכלל, ואין כרגע גרסאות מכווצות או אריזת דוקר מוכנה.

מבחינת ביצועים, כרטיס ברמת ארבעת אלפים מייצר בערך 40 טוקנים לשנייה, כאשר שנייה אחת של אודיו דורשת 86 טוקנים. זה אומר שעל חומרה כזו הקצב הוא חצי מזמן אמת, ורק כרטיסי שרת חזקים מגיעים למהירות מלאה. אם אין לכם גישה למעבדים גרפיים חזקים ויציבים, עדיף להשתמש בממשק חיצוני או לחכות לגרסאות עתידיות.

pip install -U huggingface_hub
hf download nari-labs/Dia-1.6B-0626

הרישיון

הרישיון הוא אפאצ'י שתיים אפס, מה שמאפשר שימוש חופשי, שינוי קוד ושילוב במוצרים מסחריים בלי תשלום תמלוגים. עם זאת, יוצרי הדגם אסרו מפורשות שימוש בו לצורך חיקוי אנשים ללא אישורם, הפצת מידע כוזב או כל פעילות בלתי חוקית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗