GPT
B

bark

קוד פתוח

sunomit2023-04-25

  • transformers
  • pytorch
  • bark
  • text-to-audio
  • audio

suno עומדים גם מאחורי Suno AI, ויש עליו סקירה כאן.

הופך טקסט לקול אנושי, מוזיקה ואפקטים קוליים בלי להישמע רובוטי. מתאים למי שחייב הבעות כמו צחוק או אנחות ולא רק הקראה יבשה.

  • 20.7 GBמשקל הקבצים
  • 34,958הורדות בחודש
  • 1,561לייקים

מה זה

מדובר במודל שמייצר אודיו ישירות מטקסט, אבל במקום להסתפק בהקראה סטנדרטית הוא מתייחס לצליל כמו אל שפה. הוא מורכב מצינור של שלושה מודלי שנאי שונים: הראשון הופך את הטקסט לאסימונים סמנטיים, השני מייצר מהם אסימוני שמע גולמיים, והשלישי מחדד את התוצאה הסופית ברוחב פס של עשרים וארבעה קילוהרץ דרך המקודד של פייסבוק.

הייחוד כאן הוא השליטה בהבעות לא מילוליות. המודל יודע לשלב בתוך הדיבור צחוק, אנחות, היסוסים, רעשי רקע ואפילו קטעי שירה בסיסיים, דברים שמערכות דיבור ישנות פשוט חותכות. החבילה הזו תומכת בשמונה שפות בהן אנגלית, גרמנית, ספרדית, צרפתית, הינדי, איטלקית, יפנית וקוריאנית.

מתאים ל

  • הקראת דיאלוגים מורכבים

    יצירת קטעי משחק ופודקאסטים באנגלית שדורשים צחוק, היסוסים ונשימות בין המילים.

  • הפקת אפקטי שמע קצרים

    יצירת רעשי רקע, מוזיקה פשוטה וצלילי אווירה ישירות מתיאור טקסטואלי.

  • הנגשת אתרים רב לשונית

    המרת טקסטים לדיבור שנשמע טבעי בשפות כמו גרמנית, צרפתית, ספרדית או יפנית.

איפה זה נופל

הפלט לא עובר שום צנזורה או סינון תכנים, והיוצרים מציינים במפורש שהשימוש הוא על אחריותכם בלבד. הוא לא תומך בעברית, כך שהוא לא יעזור למוצרים שמכוונים לקהל מקומי שדורש הקראה בעברית.

בנוסף, המבנה המדורג שלו דורש זמן עיבוד ממושך לכל משפט, ולא קל לשכפל איתו קולות ספציפיים בצורה מדויקת או עקבית לאורך זמן.

שאלות
נפוצות

האם המודל יודע להקריא טקסטים בעברית?

לא. רשימת השפות הנתמכות כוללת אנגלית, גרמנית, ספרדית, צרפתית, הינדי, איטלקית, יפנית וקוריאנית בלבד. ניסיון להזין עברית ייכשל או ייצר ג'יבריש קולי.

האם אפשר לשבט איתו קול של אדם מסוים בצורה אמינה?

היוצרים מציינים במפורש ששכפול קולות מוכרים אינו פשוט באמצעות הכלי הזה. הוא מייצר קולות מגוונים ואנושיים, אך לא נועד כפתרון לשכפול קול מוגדר ומדויק.

איך מריצים

אתם מריצים אותו מקומית עם ספריית transformers של הגרסה העדכנית או ישירות דרך הספרייה הייעודית של היוצרים בגיטהאב. הוא שוקל מעל עשרים ג'יגה בייט בגלל פיצול למאות קבצים ודיוק של נקודה צפה מלאה, כך שתצטרכו כרטיס מסך חזק עם שפע זיכרון ייעודי כדי להריץ את גרסת הלארג' הזו בזמן סביר.

קיימת גרסה קטנה יותר שמתאימה לחומרה צנועה, אבל אם אין לכם שרת ייעודי פנוי, עדיף להריץ בדיקות ראשוניות במחברת גוגל קולאב או לצרוך אותו דרך שירות ענן מנוהל במקום להחזיק תשתית כבדה.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="suno/bark")
print(pipe("שלום"))

הקבצים

799 קבצים במאגר, 20.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון mit חופשי, מה שמתיר שימוש מסחרי, שינוי והפצה בלי תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. עם זאת, היוצרים הוסיפו הערה שהמודל נועד למטרות מחקר, כך שכדאי לשקול את הסיכון המשפטי והמוצרי לפני שמשלבים אותו ישירות בליבת מערכת מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗