GPT
C

csm-1b — הדגמה

קוד פתוח

sesameapache-2.02025-03-06

  • gradio

הכלי מייצר שיחה קולית בין שני דוברים מתוך טקסט כתוב ודוגמאות קול. הוא מיועד למי שרוצה לבדוק מודל דיבור שיחתי ישירות בדפדפן בלי להרים שרת.

  • 1.6Bפרמטרים
  • 18.2 GBמשקל הקבצים
  • הורדות בחודש
  • 863לייקים

מה זה

אתם מזינים תסריט שיחה בתיבת טקסט ובוחרים קולות עבור שני דוברים שונים. לכל דובר אפשר לבחור קול מוכן מראש, או לפתוח תפריט ייעודי ולהעלות קובץ שמע משלכם יחד עם תמלול הטקסט שלו. בסיום התהליך מקבלים קובץ שמע מחובר עם סימון מים מובנה שמכיל את כל השיחה המדוברת.

מאחורי הקלעים רץ המודל CSM בגרסת מיליארד פרמטרים, שמבוסס על שלד של Llama 3.2 1B יחד עם מפענח שמע שמפיק קודי Mimi. המערכת מקבלת טקסט וקול, ממירה אותם לייצוגי שמע, ומרכיבה את רצף הדיבור לפי התורות שהגדרתם. הדוגמאות המובנות מתבססות על נתוני שיחה ודיבור ממאגרי EdAcc ו־LibriTTS-R.

מתאים ל

  • הפקת פודקאסט מטקסט

    יצירת דיאלוג מלא בין שני דוברים לצורך הדמיית ראיון או תוכנית שמע.

  • הדגמת קול מותאם אישית

    בדיקת המודל עם הקלטה ותמלול עצמאיים לקבלת סגנון דיבור ייחודי.

  • בדיקת יכולות דיבור שיחתי

    הערכת תזמון, החלפת תורות ואיכות שמע לפני הטמעה מקומית של המודל.

איפה זה נופל

אם התסריט שלכם דורש יותר משלוש דקות עיבוד, ההרצה תיעצר בשגיאה ותצטרכו לשכפל את החלל לחשבון פרטי. ההדגמה מוגבלת לשני דוברים בלבד ואינה מתאימה לשיחות מרובות משתתפים. מעבר לכך, כל תוצרי השמע כוללים סימון מים מוטמע בקוד, והמפתחים אוסרים במפורש שימוש להונאה, התחזות ללא הסכמה או הפצת מידע כוזב.

שאלות
נפוצות

האם השימוש בהדגמה כרוך בתשלום?

לא, הגישה דרך הדפדפן חופשית לחלוטין. ההגבלה היחידה היא תקרת זמן חומרה של שלוש דקות לכל הרצה.

האם אפשר להריץ את זה מקומית על המחשב?

כן, הקוד זמין במאגר SesameAILabs/csm בגיטהאב ומשקלי המודל פתוחים להורדה. תצטרכו חומרה תואמת כדי להריץ את המודלים.

מה קורה לקבצי הקול שאני מעלה?

הקבצים מועלים ישירות להרצת הגראדיו לצורך יצירת הדיבור, ועוברים המרה למונו אם הם מרובי ערוצים. הם אינם נשמרים כמאגר ציבורי קבוע דרך הממשק.

במה הדף הזה שונה מהמודל המלא?

מדובר בממשק בדיקה מוגבל לשני דוברים ועד שלוש דקות ריצה על מעבד גרפי. המודל הבסיסי עצמו גמיש יותר ומאפשר פיתוח מותאם בקוד.

איך מריצים

בוחרים דוברים, מדביקים את הדו-שיח בתיבה ולוחצים על כפתור יצירת השיחה. האפליקציה רצה על חומרת A10G של חצי שרת דרך ZeroGPU, כך שהיא נטענת ומתחילה לעבד רק ברגע הבקשה. זמן השימוש המרבי במעבד הגרפי מוגבל לשלוש דקות בלבד לכל הרצה, ואם התסריט והקולות ארוכים מדי תקבלו שגיאה. אם תעלו קובץ שמע מרובה ערוצים, הוא יומר אוטומטית למונו.

pip install -U huggingface_hub
hf download sesame/csm-1b

הרישיון

הפרויקט מפורסם תחת רישיון apache-2.0 שמאפשר שימוש חופשי, שינוי והפצה של הקוד. תנאי השימוש של היוצרים אוסרים במפורש חיקוי קול של אנשים ללא הסכמתם או יצירת תוכן מטעה. הקוד והמשקלים פתוחים להורדה גם בגיטהאב.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗