GPT
A

acestep-v15-base

קוד פתוח

ACE-Stepmit2026-01-23

  • transformers
  • safetensors
  • acestep
  • feature-extraction
  • audio

מודל בסיס פתוח ליצירת מוזיקה מטקסט, שמיועד בעיקר למי שמתכנן אימון המשך או משימות עריכת אודיו מתקדמות. הוא מאפשר ריצה מקומית קלה אבל מגיע ללא כיוונון עדין.

  • 2.4Bפרמטרים
  • 32,768טוקנים בהקשר
  • 4.5 GBמשקל הקבצים
  • 2,733הורדות בחודש

מה זה

מדובר במודל הדיפוזיה הבסיסי מתוך משפחת ACE-Step 1.5, בגודל של כמעט 2.4 מיליארד פרמטרים וארכיטקטורת DiT. הייחוד של גרסת הבסיס הזו לעומת גרסאות הטורבו או ה־SFT של אותו פרויקט הוא מגוון היכולות המבניות שלה. היא תומכת בפיצ'רים שבוטלו בגרסאות המכווננות, כמו חילוץ אלמנטים, הרכבת לגו מוזיקלית והשלמת קטעים, לצד יצירה מטקסט, יצירת קאברים, ושינוי מקטעים קיימים.

המודל אומן על שילוב של מוזיקה ברישיון, קטעים ללא זכויות יוצרים ודאטה סינתטי שנוצר מהמרות מידי לאודיו. לפי הטבלה של היוצרים, איכות הפלט שלו מוגדרת בינונית בלבד ביחס לגרסאות האחרות, אך הגיוון שלו גבוה והוא מוגדר כקל ביותר לביצוע פיין־טיונינג.

מתאים ל

  • בסיס לפיין טיונינג

    היוצרים מגדירים אותו כקל ביותר להתאמה, ולכן הוא נקודת פתיחה מצוינת לאימון על סגנונות מוזיקליים ייחודיים.

  • עריכת אודיו ופירוק קטעים

    הוא כולל יכולות ייחודיות כמו חילוץ אלמנטים והשלמת קטעים, שלא קיימות בגרסאות המכווננות של הסדרה.

  • יצירת קאברים ושינוי מקטעים

    המודל תומך בהזנת אודיו ייחוס, יצירת גרסאות כיסוי והחלפת קטעים בתוך רצועה קיימת לפי הנחיות טקסט.

איפה זה נופל

החיסרון המרכזי כאן הוא איכות הסאונד הראשונית. היוצרים עצמם מסמנים את איכות הפלט של גרסת הבסיס כבינונית, מאחר שהיא לא עברה כיוונון עדין או למידת חיזוק. אם תריצו אותו כמו שהוא, התוצאה תהיה פחות מלוטשת בהשוואה למודלים שמכוונים ישירות למוצר קצה. בנוסף, הוא מצריך 50 צעדי דיפוזיה, מה שהופך כל יצירה לאיטית משמעותית ביחס לגרסאות הטורבו המזוקקות.

אותה משפחה

acestep יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את גרסת הבסיס הזו כדי לייצר מוזיקה למוצר שלי?

ברוב המקרים לא. גרסת הבסיס לא עברה כיוונון עדין ומפיקה איכות בינונית ב־50 צעדים. אם אתם רק רוצים לייצר שירים מוכנים, עדיף להשתמש בגרסת הטורבו של אותו פרויקט, שנותנת איכות גבוהה בהרבה בריצה של שמונה צעדים.

אילו משימות מיוחדות אפשר לעשות רק עם הגרסה הזו?

לפי מפרט היוצרים, זו הגרסה היחידה בסדרה שתומכת במשימות של חילוץ אלמנטים מתוך קטע קיים, הרכבת שכבות מוזיקה והשלמת קטעים חסרים. הגרסאות המהירות והמכווננות יותר איבדו את היכולות האלה בתהליך האימון שלהן.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.5 גיגה־בייט, והכרטיס מציין שסדרת המודלים הזו מסוגלת לרוץ מקומית עם פחות מ־4 גיגה־בייט זיכרון וידאו. על כרטיס A100 יצירת שיר מלא לוקחת פחות מ־2 שניות, ועל RTX 3090 פחות מ־10 שניות, כך שאין צורך בשרתי ענק כדי לעבוד איתו.

קחו בחשבון שגרסת הבסיס הזו דורשת 50 צעדי דגימה ועובדת עם מנגנון CFG, בניגוד לגרסאות הטורבו שרצות בשמונה צעדים בלבד. אם המטרה היא לקבל שיר מוכן ומהיר ישירות מהקופסה בלי לבצע אימון נוסף, עדיף להשתמש בגרסת הטורבו של הפרויקט או לפנות לשירות מנוהל.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="ACE-Step/acestep-v15-base")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון MIT, שזה הרישיון הפתוח והמתירני ביותר שיש. מותר לקחת את המשקלים, לשנות אותם, לאמן עליהם, לשלב אותם בכל מוצר מסחרי סגור ולמכור את התוצרים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗