GPT
B

bark-small

קוד פתוח

sunomit2023-07-18

  • transformers
  • pytorch
  • bark
  • text-to-audio
  • audio

suno עומדים גם מאחורי Suno AI, ויש עליו סקירה כאן.

הופך טקסט לדיבור, מוזיקה ואפקטים קוליים בחבילה של 1.6 גיגה בייט. מתאים למי שרוצה קולות אנושיים שכוללים צחוק או אנחות בלי להרים תשתית כבדה.

  • 1.6 GBמשקל הקבצים
  • 32,169הורדות בחודש
  • 262לייקים

מה זה

בניגוד למנועי דיבור ישנים שנשמעים כמו קריין מוקלט באולפן, המודל הזה מתייחס לאודיו כמו שטקסט מעובד במודלי שפה. הוא מורכב משלושה תתי מודלים שעובדים ברצף, מטקסט גולמי לייצוג סמנטי, משם לייצוג אקוסטי גס, ולבסוף לאודיו של עשרים וארבעה קילוהרץ דרך קידוד מבוסס טוקנים. החבילה הקטנה מחזיקה שמונים מיליון פרמטרים בכל שלב, לעומת שלוש מאות מיליון בגרסה הגדולה.

מעבר לדיבור בשמונה שפות, כולל אנגלית, צרפתית, גרמנית, ספרדית, הינדי, איטלקית, יפנית וקוריאנית, הוא מייצר מוזיקה פשוטה, רעשי רקע ותגובות לא מילוליות כמו בכי או צחוק ישירות מתוך הטקסט שתזינו לו. התוצאה מרגישה הרבה יותר חיה ופחות רובוטית, במיוחד כשמשלבים בטקסט סימונים מתאימים.

מתאים ל

  • דיבוב משחקים פשוטים

    יצירת שורות דיבור שכוללות גיחוכים, אנחות ואפקטים קוליים קלים בלי לשכור מדבבים.

  • הקראת טקסט מרובת שפות

    הפקת אודיו שנשמע טבעי בשפות כמו אנגלית, ספרדית או יפנית מתוך חומרי קריאה קיימים.

  • אב טיפוס למחקר קולי

    בדיקת יכולות המרת טקסט לסאונד על מחשב מקומי בלי צורך בשרתים מפלצתיים.

איפה זה נופל

המודל הזה אינו מצונזר כלל, והיוצרים מציינים במפורש שהפלט עשוי להכיל תוכן בלתי צפוי. עברית אינה מופיעה ברשימת השפות הנתמכות, ולכן ניסיון להזין לו טקסט מקומי יוביל כנראה לג'יבריש מוחלט. בנוסף, המבנה הטורי של שלושת השלבים מייצר זמני תגובה מורגשים, והוא מוגדר רשמית למטרות מחקר בלבד, מה שמחייב בדיקות זהירות מאוד לפני חיבור למשתמשי קצה.

שאלות
נפוצות

האם המודל תומך בהקראת עברית?

לא. רשימת השפות הנתמכות כוללת שמונה שפות בלבד, ביניהן אנגלית, ספרדית, יפנית וקוריאנית, ועברית אינה אחת מהן. הזנת טקסט בעברית לא תניב פלט תקין.

מה ההבדל העיקרי בין גרסת הסמול לגרסה הרגילה?

גרסת הסמול בנויה על שמונים מיליון פרמטרים בכל שלב במקום שלוש מאות מיליון בגרסה המלאה. היא דורשת הרבה פחות זיכרון ומאפשרת ריצה מהירה יותר על חומרה ביתית, אך על חשבון עומק ואיכות הצליל.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.6 גיגה בייט, כך שאפשר להריץ אותו מקומית כמעט על כל כרטיס מסך מודרני, או אפילו על מעבד אם מוכנים לחכות. כדי לקבל ביצועים סבירים מומלץ לטעון אותו בחצי דיוק, מה שחותך בחצי את צריכת הזיכרון, ולהפעיל פריקה של תת המודלים לזיכרון המחשב כשאינם פעילים כדי לחסוך עד שמונים אחוזים מצריכת כרטיס המסך.

אם יש לכם מעבד גרפי שתומך בכך, שימוש בטכנולוגיות האצה כמו פלאש אטנשן שתיים יקצר זמנים, אבל מדובר בתהליך כבד יחסית של שלושה מעברים עוקבים. אם המטרה היא מענה בזמן אמת לשיחות קוליות, עדיף לפנות לשירות מנוהל חיצוני, כי הריצה המקומית עלולה להיות איטית מדי לאינטראקציה חיה.

from transformers import pipeline

pipe = pipeline("text-to-speech", model="suno/bark-small")
print(pipe("שלום"))

הקבצים

793 קבצים במאגר, 1.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון MIT. המשמעות פשוטה, מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים שלכם בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗