GPT
A

acestep-v15-xl-base

קוד פתוח

ACE-Stepmit2026-04-02

  • transformers
  • safetensors
  • acestep
  • feature-extraction
  • audio

מודל בסיס ליצירה ועריכת מוזיקה שמתמקד בכל המשימות המורכבות. בוחרים בו כשצריכים מגוון יצירתי רחב ויכולות כמו פירוק, צביעה מחדש והשלמת קטעים.

  • 5Bפרמטרים
  • 32,768טוקנים בהקשר
  • 18.6 GBמשקל הקבצים
  • 1,607הורדות בחודש

מה זה

מדובר במודל מבוסס DiT שמיועד ליצירת אודיו מטקסט וכולל תמיכה במגוון משימות עיבוד: יצירת שירים מלאים, קאברים, עריכת קטעים ספציפיים, חילוץ ערוצים, והשלמה של חלקי מוזיקה. בעוד שגרסאות ה־SFT וה־Turbo של אותה סדרה מוגבלות רק למשימות סטנדרטיות, גרסת הבסיס הזו שומרת על גמישות מלאה ומציעה גיוון צלילי גבוה יותר, במחיר של איכות מלוטשת מעט פחות מהגרסאות המכווננות.

המודל אומן על שילוב של מוזיקה ברישיון, נחלת הכלל, ודאטה סינתטי שנוצר מ־MIDI, כך שהחומרים מאפשרים שימוש מסחרי לפי המפתחים. הוא משתמש ב־50 צעדי דגימה עם הנחיית CFG כדי לחשב את התוצאה, ועובד בשילוב עם מודלי שפה נפרדים של הפרויקט בגדלים שבין 0.6B ל־4B שמטפלים בהבנה ובהלחנה.

מתאים ל

  • עריכה וחילוץ ערוצים

    היחיד במשפחת ה־XL שתומך במשימות extract ו־lego לפירוק והרכבה מחדש של רצועות שמע.

  • מחקר ואימון המשך

    מודל הבסיס שומר על מגוון צלילי מקסימלי, ולכן מתאים לכוונון עדין על סגנונות חדשים.

  • השלמת קטעי סאונד

    מאפשר תיקון וצביעה מחדש של שגיאות בהקלטה או השלמת מקטעים חסרים בקובץ קיים.

איפה זה נופל

זהו מודל בסיס ולא גרסת SFT, מה שאומר שאיכות האודיו הסופית מוגדרת כגבוהה אך פחות מהוקצעת מהחלופות המכווננות. הוא דורש 50 צעדי אינפרנס עם CFG, כך שזמני התגובה ארוכים וכבדים מאוד על החומרה. בנוסף, הוא תלוי במודל שפה חיצוני כדי לבצע הלחנה והבנה של הפרומפט, כך שהביצועים תלויים גם בגודל ה־LM שתבחרו להצמיד לו.

אותה משפחה

acestep-v15-xl יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה לקחת את גרסת הבסיס ולא את גרסת ה־Turbo?

גרסת ה־Turbo מהירה בהרבה ודורשת רק 8 צעדים, אך היא מוגבלת ליצירת מוזיקה סטנדרטית בלבד. אם אתם צריכים לפרק רצועות, לערוך קטעים קיימים או לקבל מגוון יצירתי רחב, תהיו חייבים להשתמש בגרסת הבסיס.

האם אפשר להריץ אותו על מחשב אישי ממוצע?

רק אם יש לכם כרטיס מסך מודרני עם לפחות 12GB זיכרון ותסכימו לעבוד עם INT8 ופריקת עומס למעבד. להפקה סבירה ובאיכות מלאה תצטרכו כרטיס מקצועי של 24GB לפחות, לצד זיכרון עבור מודל השפה המלווה.

איך מריצים

כדי להריץ את המודל ללא פשרות, במיוחד אם משלבים אותו עם מודל השפה הגדול של 4B, תצטרכו כרטיס מסך עם לפחות 24GB זיכרון. אם יש לכם בין 12GB ל־16GB, עדיין תוכלו להריץ אותו, אבל תצטרכו להפעיל פריקה של משקלים למעבד המרכזי וקוונטיזציה ל־INT8, מה שיאט משמעותית את זמן היצירה.

ההרצה דורשת 50 צעדי אינפרנס מלאים, כך שלא מדובר בכלי מהיר כמו גרסת ה־Turbo שעובדת ב־8 צעדים. מורידים את המשקלים דרך huggingface-cli, מתקינים את המאגר מגיטהאב, ומריצים את ממשק ה־Gradio המובנה.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="ACE-Step/acestep-v15-xl-base")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון MIT, מה שנותן חופש כמעט מוחלט. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים קנייניים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. המפתחים גם מציינים שהאימון נעשה על חומרים מורשים ומאגרים חוקיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗