GPT
Y

YuE-s1-7B-anneal-en-cot

קוד פתוח

m-a-papache-2.02025-01-26

  • safetensors
  • llama
  • music
  • art
  • text-generation-inference

מודל שמייצר שירים מלאים באנגלית עם שירה וליווי ישירות ממילים. הוא מיועד למי שרוצה שליטה עצמאית בהפקת מוזיקה בקוד פתוח בלי להסתמך על שירותים סגורים.

  • 6.2Bפרמטרים
  • 16,384טוקנים בהקשר
  • 11.6 GBמשקל הקבצים
  • 5,926הורדות בחודש

מה זה

מדובר במודל שפה בארכיטקטורת Llama שמתמקד ביצירת שירים שלמים באנגלית על בסיס מילים. הוא מייצר רצועת שירה ורצועת ליווי במקביל, ומסוגל להחזיק מבנה מוזיקלי שנמשך מספר דקות. החלק הספציפי הזה במערכת מייצג את השלב הראשון (Stage 1) בתהליך היצירה, ומשתמש בגישת שרשרת מחשבה (Chain of Thought) כדי לתכנן את המוזיקה לפני הפקת האודיו.

בניגוד למודלים גנריים בגודל שישה מיליארד פרמטרים שפולטים רק טקסט, המודל הזה עבר כוונון ייעודי לתחום המוזיקלי כדי לחבר בין טקסט כתוב לאותות סאונד. הוא חלק מצינור עבודה רחב יותר שדורש בדרך כלל גם מודל שלב שני ומודל upsampler כדי להגיע לקובץ סאונד מלא.

מתאים ל

  • הפקת שירים שלמים ממילים

    יצירת רצועת שירה ורצועת ליווי באנגלית מתוך טקסט כתוב, למשך כמה דקות של שיר.

  • ייצור סקיצות מוזיקליות

    בניית רעיונות ראשוניים להפקה מוזיקלית עצמאית ללא תלות בכלים סגורים או שירותי ענן בתשלום.

  • שילוב במערכות יצירת מדיה

    הטמעה בצינורות עיבוד מקומיים להפקת אודיו מקורי תחת רישיון פתוח שמתיר שימוש מסחרי.

איפה זה נופל

המודל מוגדר עבור השפה האנגלית בלבד, כך שמילים בעברית לא יעבדו כאן. בנוסף, הוא לא פועל לבד. כדי לקבל שיר שנשמע טוב חייבים לחבר אותו למודל השלב השני ול־upsampler, מה שהופך את כל תהליך ההסקה לאיטי וכבד. היוצרים גם מציינים במפורש את האחריות לבדוק שהתוצרים אינם מפרים זכויות יוצרים של יצירות קיימות.

שאלות
נפוצות

האם המודל מייצר קובץ אודיו ישירות מטקסט?

לא לבד. מדובר במודל השלב הראשון בתהליך. כדי לייצר שיר מלא באיכות טובה צריך להעביר את הפלט שלו דרך מודל Stage 2 ואז דרך מודל upsampler, כפי שמפורט במאגר הפרויקט.

האם הוא תומך במילים בעברית?

לא. גרסה זו מאומנת על השפה האנגלית בלבד. ישנן גרסאות אחרות של הפרויקט לשפות אסייתיות, אך אין תמיכה בעברית.

האם אפשר להריץ אותו על מחשב ביתי בלי כרטיס מסך ייעודי?

לא בצורה מעשית. המודל שוקל 11.6 גיגה בייט ודורש מעבד גרפי. עם זאת, בעזרת גרסאות מכווצות אפשר להריץ אותו על כרטיסי מסך ביתיים מודרניים עם 8 גיגה זיכרון וידאו.

איך מריצים

המשקל של הקבצים מגיע ל־11.6 גיגה בייט, כך שבדיוק המקורי של bfloat16 תצטרכו כרטיס מסך עם לפחות 16 גיגה זיכרון כדי לטעון אותו, ועדיף 24 גיגה לעבודה חלקה עם חלון הקשר של 16,384 טוקנים. אם משתמשים בגרסאות מכווצות (quantized) דרך ממשקים קהילתיים כמו YuE-UI, אפשר להריץ אותו גם על כרטיסים של 8 גיגה זיכרון.

בגלל שמדובר רק ברכיב אחד מתוך שרשרת שכוללת גם מודל שלב שני ומודול upsampler, הרצה מקומית דורשת הגדרה מורכבת של כל הצינור. אם אתם מחפשים תוצאה מהירה בקליק בלי לנהל תלויות כבדות, הפתרון הזה ידרוש מכם יותר עבודה בהשוואה לכלים מוכנים.

pip install -U huggingface_hub
hf download m-a-p/YuE-s1-7B-anneal-en-cot

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשלב אותו במוצרים, להפיץ ולשנות את הקוד והמשקלים. היוצרים מבקשים לתת קרדיט בשם YuE by HKUST/M-A-P וממליצים לתייג יצירות שנוצרו בעזרתו כתוכן מבוסס בינה מלאכותית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗