GPT
S

SoulX-Singer

קוד פתוח

Soul-AILabapache-2.02026-02-06

  • huggingface_hub
  • text-to-audio
  • music
  • singing-voice-synthesis
  • svs

מודל לשירה שמייצר קולות שירה חדשים לגמרי בלי אימון מראש על הזמר. אם צריך שליטה מדויקת בתווים ובגובה הצליל מתוך קובצי מידי או עקומות תדר, זה בדיוק מה שהוא מציע.

  • 5.2 GBמשקל הקבצים
  • 1,367הורדות בחודש
  • 176לייקים

מה זה

מדובר במערכת לסינתזת קול שירה באיכות גבוהה שעובדת בגישת זירו שוט. המשמעות היא שאין צורך לאמן מודל נפרד עבור כל קול חדש, אלא אפשר לספק דגימת קול של זמר שלא הופיע באימון והוא יידע לחקות את גוון הקול שלו. הוא יודע לשיר באנגלית ובסינית, ומתמקד ביצירת שירה טבעית עם הבעה.

הייחוד כאן מול מודלי דיבור רגילים הוא השליטה המוזיקלית הישירה. הוא תומך בהזנה כפולה לבחירה: עקומת תדר יסודי כדי להגדיר את הגובה המדויק בכל רגע, או תווי מידי שמכתיבים מלודיה וקצב. השילוב הזה מאפשר לו לייצר ביצוע שנשמע כמו שירה אנושית עם דיוק מוזיקלי, בלי הזיופים והמריחות שקוראים במודלי טקסט לדיבור שמנסים לאלץ אותם לשיר.

מתאים ל

  • הפקת סקיצות לשירים

    יצירת שירה ראשונית באנגלית מתוך קובצי מידי כדי לבדוק לחנים בלי לשכור זמרים.

  • דיבוב דמויות מזמרות

    התאמת שירה לקול קיים של דמות במשחק מחשב בעזרת יכולת הזירו שוט.

  • מחקר מוזיקלי וסינתזת קול

    בדיקת התנהגות מודלים מבוססי עקומות תדר תחת רישיון פתוח שמתיר שינויים.

איפה זה נופל

הבעיה המרכזית עבור מפתחים בארץ היא השפות. המודל תומך רשמית רק באנגלית ובסינית, כך שאין כאן שום תמיכה מובנית בעברית ולא הייתי בונה עליו להפקות מקומיות בלי אימון נוסף משמעותי. מעבר לזה, המערכת תלויה לחלוטין באיכות הקלט המוזיקלי שתספקו לה. אם עקומת התדר לא מדויקת או שתווי המידי לא יושבים טוב על הטקסט, התוצאה תשמע לא טבעית. ההרצה גם דורשת תלות במודל עיבוד מקדים נפרד, מה שמסבך את תהליך הפריסה בשרת ייצור ומחייב בדיקה של זמני העיבוד לפני שמשלבים אותו במוצר חי.

שאלות
נפוצות

האם המודל יודע לשיר בעברית?

לא. התמיכה המדווחת כוללת רק אנגלית וסינית. נסיונות להזין טקסט בעברית לא יעבדו בלי התאמה ואימון ייעודי של שכבות ההגייה.

מה בדיוק צריך להזין לו כדי שישיר?

צריך לספק טקסט יחד עם הכוונה מוזיקלית. המודל מקבל עקומת תדר יסודי כדי לקבוע גובה צליל רציף, או תווי מידי שמגדירים את המלודיה והקצב.

איך מריצים

המודל שוקל 5.2 גיגה בייט ומחולק לשבעה קבצים, אבל תהליך ההרצה דורש להוריד גם מודל עיבוד מקדים נפרד מהמאגר של המפתחים. ההתקנה נשענת על סביבת פייתון 3.10 וריצת סקריפט מתוך הריפו של הפרויקט.

בגלל המשקל הכולל של המודלים ופעולות העיבוד המקדים, צריך כרטיס מסך ייעודי סביר עם מספיק זיכרון וידאו כדי לטעון הכל ולהריץ חישובים בזמן נסבל. אם המטרה היא בדיקה ראשונית בלבד, עדיף להאזין לדוגמאות בדף הדמו שהמפתחים העלו לפני שמתחילים להוריד את כל המשקל הזה למחשב המקומי.

pip install -U huggingface_hub
hf download Soul-AILab/SoulX-Singer

הקבצים

7 קבצים במאגר, 5.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא אפאצ'י 2.0 מלא. אפשר להשתמש בקוד ובמשקולות המודל לפרויקטים מסחריים או מחקריים, לשנות אותם ולהפיץ מוצרים שמבוססים עליהם. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗