GPT
M

Xenova/musicgen-small

קוד פתוח

Xenovacc-by-nc-4.02024-03-26

  • transformers.js
  • onnx
  • musicgen
  • text-to-audio

המרה של מודל המוזיקה של מטא למשקלי ONNX. הוא מאפשר לייצר קטעי שמע מטקסט ישירות בסביבת ג'אווהסקריפט או בדפדפן בלי שרת פייתון ברקע.

  • 14.1 GBמשקל הקבצים
  • 3,719הורדות בחודש
  • 51לייקים

מה זה

מדובר בהסבה של musicgen-small מבית פייסבוק לפורמט ONNX, שפותחה במטרה לעבוד עם ספריית Transformers.js. המודל לוקח תיאור טקסטואלי חופשי, כולל סגנון, מקצב וכלי נגינה, ומייצר מתוכו רצועת אודיו גולמית שניתן לשמור כקובץ WAV. בניגוד לגרסה המקורית שדורשת סביבת פייתון ותלויות כבדות כמו PyTorch, כאן אפשר להריץ את כל תהליך ההסקה בקוד צד לקוח או ב־Node.js.

המשקל הכולל של הקבצים במאגר מגיע ל־14.1 גיגהבייט על פני 57 קבצים שונים, כיוון שהוא מכיל תצורות ומשקלים שונים לרכיבי המערכת, כולל דחיסה ל־q8 בחלק מהחלקים ו־fp32 באחרים. היתרון העיקרי שלו הוא הנגישות למפתחי ווב שרוצים לשלב יצירת מוזיקה ישירות ביישום מקומי בלי לנהל תשתית שרתים ייעודית.

מתאים ל

  • פיתוח כלי יצירה בדפדפן

    מאפשר לייצר דמואים אינטראקטיביים של אודיו ב־JavaScript בלי להקים שרת backend כבד.

  • פרויקטי קוד פתוח אישיים

    מתאים לניסויים ביצירת מוזיקה מטקסט בסביבת Node.js שאינם מיועדים למכירה או לרווח.

  • בדיקת יכולות ONNX ברשת

    טוב לבחינת ביצועי הסקה מקומיים של מודלי שמע מורכבים במכשירי קצה לפני פיתוח רחב.

איפה זה נופל

המאגר הזה הוא פתרון זמני של המפתח עד שתחום ה־WebML יתייצב, מה שאומר שהמבנה שלו עשוי להשתנות בעתיד. מעבר לזה, יצירת מוזיקה באיכות טובה מוגבלת כאן לאודיו קצר יחסית לפי כמות הטוקנים שמוגדרת בריצה, ודחיסת המשקלים ל־q8 כדי לאפשר ריצה מקומית עלולה לפגוע בדיוק הצליל לעומת המודל המקורי.

שאלות
נפוצות

האם המודל מתאים למוצר מסחרי שגובה תשלום מלקוחות?

לא. הרישיון הוא לא מסחרי באופן מפורש, ולכן אי אפשר לשלב אותו באפליקציה בתשלום או כחלק מפעילות עסקית שמניבה הכנסות.

האם חייבים להוריד את כל 14 הגיגהבייט כדי להריץ שיר קצר?

לא מורידים הכל בבת אחת. המאגר מכיל גרסאות שונות וקובצי משקלים שונים, והקוד טוען רק את הקבצים שמוגדרים לפי הדיוק שבחרתם, כמו גרסת ה־q8 המצומצמת.

איך מריצים

ההרצה מתבצעת באמצעות התקנת החבילה של Transformers.js מ־NPM. בקוד טוענים את הטוקנייזר ואת המודל עם חלוקת דיוק מתאימה, למשל q8 למקודד הטקסט ולדקודר ו־fp32 לפענוח האודיו, מעבירים פרומפט ומייצרים דגימות בעזרת פונקציית הג'נרייט.

למרות שמדובר בגרסת small, 14.1 גיגהבייט של קבצים במאגר אומרים שזה לא משהו שמורידים כלאחר יד בכל טעינת עמוד רגילה ברשת. זה דורש זיכרון עבודה משמעותי ומעבד חזק במכשיר הקצה, ואם אתם בונים שירות שצריך לענות מהר להרבה משתמשים בו־זמנית, API מרוחק עדיין יהיה פתרון יציב יותר.

pip install -U huggingface_hub
hf download Xenova/musicgen-small

הקבצים

57 קבצים במאגר, 14.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות ברורה וחדה, אסור להשתמש במודל הזה בשום מוצר, שירות או יישום למטרות מסחריות או רווח. הוא מיועד למחקר, ניסויים ופרויקטים אישיים בלבד, ומחייב מתן קרדיט ליוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗