GPT
D

DiffRhythm2

קוד פתוח

ASLP-labapache-2.02025-10-13

  • safetensors

הוא מייצר שירים שלמים עם שירה ומילים מסונכרנות על בסיס מודל דיפוזיה. מיועד למי שמחפש פתרון קוד פתוח עצמאי להפקת שירים בלי להסתמך על שירותי ענן סגורים.

  • 1.1Bפרמטרים
  • 4.7 GBמשקל הקבצים
  • 1,608הורדות בחודש
  • 48לייקים

מה זה

הארכיטקטורה נשענת על שילוב של דיפוזיה ושיטות סמי אוטורגרסיביות יחד עם מנגנון שנקרא בלוק פלו מאצ'ינג. המטרה כאן היא לייצר שיר שלם עם מבנה מוזיקלי ברור, במקום קטעי אודיו קצרים ומקוטעים. החידוש המרכזי מול הדור הראשון מתמקד בשיפור הסנכרון בין הטקסט לקול, כך שהשירה יושבת במדויק על המקצב והמלודיה.

בגודל של 1.1 מיליארד פרמטרים הוא שוקל פחות מחמישה גיגהבייט. זה הופך אותו לנגיש בהרבה מרוב מודלי האודיו הגדולים שדורשים חוות שרתים, ומאפשר לייצר רצועות מוזיקליות שלמות תוך שמירה על עקביות לאורך כל הקטע.

הקלט דורש מילים וקובץ אודיו שמשמש כרפרנס לסגנון. בניגוד לכלים שמפיקים רק מוזיקת רקע, הפוקוס כאן הוא על שירים מלאים שמשלבים שירה אנושית מעובדת כחלק בלתי נפרד מההפקה הכוללת.

מתאים ל

  • הפקת סקיצות לשירים

    יצירה מהירה של שיר שלם עם שירה מסונכרנת לבדיקת רעיונות ומבנה מוזיקלי.

  • פיתוח כלי יצירה עצמאיים

    הטמעת מנוע יצירת מוזיקה במוצר מקומי בזכות גודל קובץ קומפקטי ורישיון חופשי.

  • מחקר בתחום דיפוזיה ואודיו

    בחינת שילוב מילים ומבנה זמני ארוך באמצעות בלוק פלו מאצ'ינג על קוד פתוח.

איפה זה נופל

היוצרים מודים ברשימת המשימות שלהם שחסרות יכולות בסיסיות: אין עדיין תמיכה בהפקת מוזיקה כלית בלבד בלי שירה, ואי אפשר להאריך שיר קיים. מעבר לזה, המודל מסתמך על רפרנס קולי, והחוקרים מתריעים מפני סכנה של הפרת זכויות יוצרים עקב דמיון סגנוני לא מכוון. תמיכה בעברית אינה מתועדת כלל, וסביר מאוד שהפונטיקה תישבר לחלוטין אם תנסו להזין טקסט שאינו אנגלית או סינית.

שאלות
נפוצות

האם המודל תומך בהזנת מילים בעברית?

הכרטיס לא מזכיר תמיכה בעברית, וההסתמכות על מנוע הפונטיקה espeak-ng מכוונת בעיקר לאנגלית ולשפות נפוצות אחרות. בלי התאמה מיוחדת, סביר להניח שהגיית המילים בעברית תהיה משובשת או לא מובנת.

האם אפשר לייצר איתו רק נעימות בלי זמר?

כרגע לא. הצוות סימן יצירת מוזיקה אינסטרומנטלית כמשימה פתוחה לעתיד, כך שהגרסה הנוכחית מתמקדת בהפקת שירים הכוללים שירה בלבד.

מה צריך לספק למודל כדי להפיק שיר?

צריך להעביר לו קובץ טקסט עם מילות השיר וקובץ אודיו בפורמט WAV שמשמש כרפרנס מוזיקלי, והוא יבנה את השיר לפי הסגנון והמילים שהגדרתם.

איך מריצים

כדי להריץ אותו צריך לשבט את המאגר ולהתקין את espeak-ng ברמת מערכת ההפעלה, כי המודל משתמש בו כדי לעבד את הפונטיקה של המילים. לאחר מכן מתקינים את התלויות בפייתון ומריצים את סקריפט ההסקה עם קובץ אודיו כרפרנס ומילות השיר. המשקלים יורדים אוטומטית בהרצה הראשונה.

המשקל עומד על 4.7 גיגהבייט, כך שכרטיס מסך מודרני עם שמונה עד שנים עשר גיגהבייט של זיכרון יספיק לעבודה מקומית. אם אין לכם חומרה ייעודית, אפשר להשתמש במרחב הציבורי בהאגינג פייס במקום להקים שרת בעצמכם.

pip install -U huggingface_hub
hf download ASLP-lab/DiffRhythm2

הקבצים

7 קבצים במאגר, 4.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בהם לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו מחדש. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והצהרת ויתור האחריות של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗