GPT
A

acestep-5Hz-lm-4B

קוד פתוח

ACE-Stepmit2026-01-23

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • audio

המודל הזה משמש כמתכנן שפה ליצירת מוזיקה, שמתרגם בקשות טקסט פשוטות למבנה שיר מלא עם מילים ומטא-דאטה. הוא מתאים למי שרוצה שליטה חכמה ביצירת אודיו בלי להסתמך על שירותים עיוורים.

  • 4.2Bפרמטרים
  • 40,960טוקנים בהקשר
  • 7.8 GBמשקל הקבצים
  • 10,176הורדות בחודש

מה זה

במקום לזרוק פרומפט ישר לתוך מודל דיפוזיה ולקוות לטוב, המודל הזה מתפקד כשלב התכנון המקדים של מערך ACE-Step 1.5. הוא מבוסס על ארכיטקטורת Qwen3ForCausalLM עם 4.2 מיליארד פרמטרים, ומנתח בקשות טקסט כדי לייצר שרשרת מחשבה, מילים, חלוקה למבנה מוזיקלי והנחיות מדויקות שמזינות את מודל הדיפוזיה של המערכת.

לפי נתוני היוצרים, זו הגרסה החזקה ביותר בסדרה שלו, מעל גרסאות ה־0.6B וה־1.7B. בטבלת ההשוואה הוא מקבל ציון חזק בהבנת אודיו, ביכולות הלחנה ובהעתקת מלודיה, תחומים שבהם הגרסאות הקטנות יותר סומנו כבינוניות או חלשות. האימון שלו כולל שלבי קדם-אימון, כוונון עדין ולמידת חיזוק פנימית בלי מודלי תגמול חיצוניים.

מתאים ל

  • תכנון מבנה שירים ומילים

    הוא מפרק בקשת משתמש פשוטה למבנה מוזיקלי, מטא-דאטה ומילים בחמישים שפות לפני שלב ההפקה.

  • העתקת מלודיה ועריכה

    הוא דורג כבעל יכולת גבוהה בהעתקת מלודיה ובהבנת אודיו ביחס לגרסאות הקלות של הפרויקט.

  • מנוע הנחיה למודלי דיפוזיה

    הוא מייצר את שרשרת המחשבה שמכוונת מודלים כמו acestep-v15 לביצועים מדויקים יותר.

איפה זה נופל

החיסרון המרכזי הוא שמדובר בחצי פתרון, המודל הזה אחראי על השפה והתכנון ולא פולט צלילים. אם תריצו רק אותו, תקבלו טקסט ומטא-דאטה ולא שיר. בנוסף, חלון ההקשר שלו מגיע ל־40,960 טוקנים, מה שעלול לייצר צריכת זיכרון משמעותית ביצירות ארוכות אם לא מנהלים את הזיכרון נכון. אין בכרטיס תיעוד לגבי איכות הטקסט והמילים בשפות שאינן אנגלית, למרות ההצהרה על תמיכה ביותר מחמישים שפות.

שאלות
נפוצות

האם המודל הזה מוציא קובץ שמע בסוף הריצה?

לא. מדובר במודל שפה שמייצר תוכנית עבודה, מילים ומטא-דאטה מוזיקלי. כדי לקבל קובץ קול אמיתי חייבים להעביר את הפלט שלו למודל הדיפוזיה המשלים של הפרויקט.

למה לבחור בגרסת ה־4B ולא בגרסאות הקטנות יותר בסדרה?

לפי נתוני המפתחים, זו הגרסה היחידה שמשיגה דירוג גבוה גם בהבנת אודיו, גם ביכולות קומפוזיציה וגם ביכולת לשחזר מלודיה קיימת, תחומים שבהם דגמי ה־0.6B וה־1.7B מתקשים.

איך מריצים

המשקל של הקבצים עומד על 7.8 ג'יגה-בייט, כך שהוא דורש סביבת הרצה עם ספריית transformers וכרטיס מסך שיכול להחזיק מודל 4B בזיכרון, סביב 10 עד 16 ג'יגה-בייט VRAM לעבודה נוחה, אם כי המערכת הכוללת תוכננה לרוץ על חומרת צרכנים עם פחות מ־4 ג'יגה-בייט כאשר משתמשים באופטימיזציות המתאימות.

חשוב לזכור שהמודל הזה לא מייצר קובץ אודיו בעצמו. הוא מייצר את התוכנית ואת הייצוג שהדיפוזיה צריכה, ולכן אין טעם להריץ אותו לבד אלא כחלק מצינור העבודה המלא של הפרויקט. אם אתם לא בונים שירות עצמאי ומחפשים רק פלט קולי סופי לפרויקט קטן, עדיף להשתמש בדמו או בנקודת קצה מוכנה במקום לחבר את שני המודלים ידנית.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="ACE-Step/acestep-5Hz-lm-4B")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצר סגור ולהפיץ אותו חופשי, כל עוד משאירים את הצהרת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗