GPT
A

acestep-v15-xl-turbo

קוד פתוח

ACE-Stepmit2026-04-02

  • transformers
  • safetensors
  • acestep
  • feature-extraction
  • audio

מודל ליצירת אודיו מטקסט שרץ בשמונה צעדים בלבד ומספק סאונד עשיר של ארבעה מיליארד פרמטרים. השילוב בין הזיקוק למהירות מאפשר הפקה זריזה בלי לחכות דקות ארוכות לכל דגימה.

  • 5Bפרמטרים
  • 32,768טוקנים בהקשר
  • 18.6 GBמשקל הקבצים
  • 4,478הורדות בחודש

מה זה

המודל הזה לוקח ארכיטקטורת DiT גדולה של ארבעה מיליארד פרמטרים ומזקק אותה כדי לייצר סאונד בשמונה צעדים בלבד, במקום חמישים צעדים שמקובלים בגרסאות הבסיס. הוא נבנה בשיתוף בין ACE Studio לבין StepFun, ומיועד ליצירת מוזיקה ישירות מהנחיות טקסטואליות או בשילוב מודלי שפה תואמים של הפרויקט.

בניגוד למודלים הקטנים יותר בסדרה, הגודל הזה נותן איכות שמע גבוהה יותר, אבל הזיקוק מגיע על חשבון מגוון היצירה. החוקרים מציינים שהמודל מאבד מעט גמישות בהשוואה לגרסת הבסיס, ובנוסף הוא רץ ללא שימוש בטכניקת Classifier-Free Guidance כדי לשמור על מהירות שיא.

נקודה מעניינת היא הדאטה שעליו הוא התאמן. היוצרים השתמשו במוזיקה ברישיון, קטעים מנחלת הכלל ודאטה סינתטי מבוסס מידי, כך שתוצרי האודיו מתאימים לפרויקטים מסחריים בלי כאבי ראש של זכויות יוצרים.

מתאים ל

  • הפקת מוזיקה מהירה למשחקים

    יצירת קטעי רקע מגוונים בזמן פיתוח כשיש צורך בסאונד איכותי בלי להמתין לעיבוד ממושך.

  • פסי קול לפרויקטים מסחריים

    התאמה מלאה לשימוש מסחרי מבוסס על אימון בחומרים מורשים ומוזיקה חופשית מזכויות.

  • סביבות יצירה אינטראקטיביות

    ריצה בשמונה צעדים מאפשרת לשלב אותו בממשקים שדורשים קבלת תוצאה מהירה לפקודות משתמש.

איפה זה נופל

המחיר של מהירות הטורבו הוא פגיעה ישירה במגוון התוצאות, שמוגדר בינוני בלבד בהשוואה לגרסת הבסיס. בנוסף, המודל תומך רק במשימות יצירה רגילות. משימות מתקדמות יותר כמו השלמת קטעים, חילוץ אלמנטים או הרכבה מורכבת שקיימות בגרסת הבסיס פשוט לא נתמכות כאן, כך שאם הפרויקט שלכם דורש עריכת אודיו גמישה, הוא לא יעשה את העבודה.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד רגיל?

לא מומלץ בכלל. הקבצים שוקלים מעל 18 גיגה והמודל דורש לפחות 12 גיגה זיכרון גרפי עם אופטימיזציות כבדות והעברת עומסים למעבד. בשביל תוצאה נורמלית תצטרכו כרטיס גרפי ייעודי של 20 גיגה ומעלה.

למה לבחור בגרסת הטורבו ולא בגרסת הבסיס?

היתרון המרכזי הוא זמן הריצה, שכן המודל מסיים עיבוד בשמונה צעדים במקום חמישים. אם אתם חייבים מהירות גבוהה למוצר חי ומוכנים לוותר על משימות עריכה מתקדמות וגיוון רחב, זו הבחירה הנכונה.

האם מותר למכור שירים שנוצרו באמצעות המודל הזה?

כן, לפי כרטיס המודל הדאטה נבחר כך שאין בעיות של זכויות יוצרים, והרישיון הוא MIT. מותר להשתמש בתוצרים לכל מטרה מסחרית שתבחרו.

איך מריצים

כדי להריץ אותו בלי שיתוף זיכרון למעבד צריך כרטיס עם עשרים גיגה זיכרון לפחות. אם תרצו להריץ אותו יחד עם מודל השפה הגדול של ארבעה מיליארד פרמטרים ולקבל איכות מקסימלית, תצטרכו כבר כרטיס של 24 גיגה.

כרטיסים צנועים יותר של 12 עד 16 גיגה יוכלו להסתדר רק אם תשתמשו בקוונטיזציה של שמונה ביט ובהעברת חישובים למעבד, מה שיאט את התהליך. אם אין לכם חומרה ייעודית כזו בענן או במשרד, עדיף להשתמש בפתרון מוכן ולא לנסות לדחוף שמונה עשר גיגה של משקלים לכרטיס ביתי חלש.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="ACE-Step/acestep-v15-xl-turbo")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT, מה שנותן חופש מלא לעשות בקוד ובמשקלים כמעט כל מה שרוצים. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לסגור אותו בתוך מוצר קנייני ולהפיץ אותו מחדש, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗