GPT
D

DiffRhythm-base

קוד פתוח

ASLP-labapache-2.02025-03-02

  • DiffRhythm
  • diffrhythm
  • music
  • art
  • diffusion

מודל דיפוזיה שמייצר שירים שלמים מקצה לקצה באנגלית ובסינית. הוא שוקל רק 2.1 גיגה בייט ומיועד למי שמחפש חלופה פתוחה וקלה ליצירת מוזיקה ושירה ישירות מטקסט.

  • 2.1 GBמשקל הקבצים
  • 65הורדות בחודש
  • 171לייקים

מה זה

המודל מתמקד ביצירת שירים מקצה לקצה באורך של דקה ושלושים וחמש שניות, תוך שילוב של שירה ומוזיקה יחד. במקום ארכיטקטורות כבדות של שפה או מודלים מרובי שלבים, המפתחים השתמשו כאן בדיפוזיה לטנטית כדי לייצר את קובץ השמע ישירות. הפרויקט מגיע ממעבדת מחקר ומציע גישה קלה יחסית מבחינת ארכיטקטורה, עם תמיכה בשפות סינית ואנגלית בלבד.

במשקל כולל של כ־2.1 גיגה בייט בגרסת הבסיס, הוא מציע פתרון קומפקטי בהרבה מרוב מה שמסתובב כרגע בתחום המוזיקה הגנרטיבית. המפתחים מכוונים אותו לשמש כבסיס למחקר ולפיתוח נוסף, כשהמטרה היא הפקת שירים מהירה בסגנונות שונים בלי להזדקק למערכות מסורבלות שמחברות כמה מודלים נפרדים.

מתאים ל

  • מחקר אודיו בדיפוזיה

    הארכיטקטורה הפשוטה והמשקל הנמוך הופכים אותו לבסיס נוח לניסויי יצירת שמע.

  • יצירת קטעי שיר קצרים

    הוא מפיק קטעים באורך דקה וחצי באנגלית ובסינית, אידיאלי לדמואים ולסרטונים.

  • פיתוח אפליקציות מוזיקה

    רישיון אפאצ'י מאפשר שילוב חופשי במערכות מסחריות שצריכות מנוע שמע מקומי.

איפה זה נופל

החיסרון המרכזי בגרסה הזו הוא מגבלת הזמן, שנעצרת בדקה ושלושים וחמש שניות של שמע, כך שאי אפשר לייצר שיר מלא באורך סטנדרטי עד שתצא גרסת ה־full. מעבר לזה, המודל אומן על סינית ואנגלית בלבד, כך שאין כאן שום תמיכה בעברית או בהגייה מקומית. היוצרים מזהירים מראש מפני סכנות של הפרת זכויות יוצרים עקב דמיון סגנוני למוזיקה קיימת, ומציינים שנדרשת בדיקה ידנית למקוריות התוכן לפני שמשלבים אותו במוצר מסחרי.

שאלות
נפוצות

האם המודל תומך בהפקת שירים בעברית?

לא. המודל מאומן באופן רשמי רק על אנגלית וסינית. הזנה של טקסט בעברית לא תעבוד כראוי ולא תפיק שירה בהגייה הנכונה.

מה ההבדל בין גרסת הבסיס לגרסת ה־full?

גרסת הבסיס הנוכחית מפיקה קטעי שמע של עד דקה ושלושים וחמש שניות בלבד. גרסת ה־full, שטרם שוחררה, מיועדת לייצר שירים באורך של ארבע דקות וארבעים וחמש שניות.

האם אפשר להריץ אותו בקלות בדוקר כרגע?

עדיין לא באופן רשמי. המפתחים סימנו תמיכה בדוקר ובקולאב כמשימות בפיתוח, כך שכרגע ההרצה המקומית דורשת הגדרה עצמאית של הסביבה והתלויות.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.1 גיגה בייט בלבד, כך שמבחינת נפח זיכרון מדובר במודל שקל מאוד להחזיק על כרטיס מסך ביתי סטנדרטי בלי להסתבך עם שרתים יקרים. כדי לעבוד איתו צריך גם את מודל ה־VAE שהמפתחים שחררו בנפרד, כשהשילוב ביניהם מרכיב את תהליך הדחיסה והיצירה של השמע.

המפתחים עצמם מציינים שפריסה מקומית, תמיכה ב־Colab ומכולות Docker עדיין נמצאות ברשימת המשימות הפתוחות שלהם. כרגע קיים דמו פעיל ב־Hugging Face Spaces, כך שאם אתם לא רוצים להרכיב את סביבת העבודה בעצמכם על פי המאמר, אפשר לבדוק את התוצאות שם לפני שמורידים את המשקולות.

pip install -U huggingface_hub
hf download ASLP-lab/DiffRhythm-base

הקבצים

7 קבצים במאגר, 2.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד ומשקולות המודל שוחררו תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי הקוד והפצה מחדש בלי תשלום תמלוגים, בתנאי ששומרים על הצהרת זכויות היוצרים וכתב הוויתור המקוריים של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗