GPT
A

ace-step-jam

רץ בדפדפן

victormit2026-04-14

  • gradio

מזינים תיאור טקסטואלי חופשי ומקבלים שיר מלא עם מילים, תגיות מוזיקליות וקובץ אודיו. הכלי מיועד למי שרוצה ליצור סקיצה מוזיקלית מהירה בלי להתעסק בהגדרות טכניות.

  • הורדות בחודש
  • 167לייקים

מה זה

אתם כותבים תיאור באנגלית שכולל ז'אנר, מצב רוח או סיפור, ולוחצים על כפתור היצירה. בשלב הראשון מודל שפה חיצוני מייצר מילים ותגיות מתאימות, ואז המודל acestep-v15-xl-turbo מייצר את האודיו בפועל. בנוסף, הקוד טוען את המודל Z-Image-Turbo כדי להפיק תמונה שמלווה את השיר.

בסיום מקבלים נגן עם תצוגת גל קול של השיר, אפשרות להוריד קובץ WAV, ויכולת לשתף את התוצאה בפיד הקהילתי של הממשק. המערכת נשענת על מודל טורבו שרץ בשמונה צעדים, לצד מודל הבסיס של Ace-Step 1.5.

מתאים ל

  • הפקת סקיצות שירים

    יצירת שיר ראשוני ומהיר מתוך רעיון כללי בלבד, כולל מילים ולחן בסיסי להתרשמות.

  • יצירת מוזיקת רקע

    הפקת קטעי אודיו קצרים לפרויקטים לפי הגדרת אווירה, קצב וז'אנר מבוקשים.

  • בדיקת יכולות המודל

    בחינה של קצב הפקת האודיו במודל הטורבו של Ace-Step מול מודלים אחרים.

איפה זה נופל

הבעיה המרכזית כרגע היא טכנית: המרחב קורס ולא עולה בכלל בגלל שגיאת ריצה. מעבר לזה, הממשק דורש תיאור באנגלית כדי שמודל השפה ייצר מילים ותגיות הגיוניות, כך שאין כאן תמיכה מובנית בעברית. אתם גם תלויים לחלוטין בבחירות שה־LLM עושה ברקע, בלי שליטה ישירה על המילים או על סגנון ההפקה לפני תחילת יצירת הסאונד.

שאלות
נפוצות

האם האפליקציה עובדת כרגע בדפדפן?

לא, המרחב מדווח כרגע על שגיאת ריצה ואינו זמין לפעולה. צריך להמתין שהיוצר יעדכן את הקוד, או להוריד אותו ולהריץ אותו באופן עצמאי. עד שזה יקרה, אי אפשר להזין טקסט וליצור שירים דרך הדפדפן.

האם השימוש בכלי הוא בחינם?

הגישה למרחב בהאגינג פייס פתוחה בחינם כשהוא פעיל. אין צורך לשלם על הזמן של כרטיס המסך המוגדר בו. עם זאת, בגלל התקלות הנוכחיות לא ניתן לנצל את המשאב הזה כרגע.

כמה זמן לוקח לייצר שיר?

המודל המוטמע מפיק בערך דקת אודיו בשתי שניות על גבי כרטיס מסך ייעודי. יחד עם יצירת המילים במודל השפה והרכבת התמונה, התהליך כולו אמור לקחת שניות בודדות בלבד. כרגע לא ניתן למדוד זאת בפועל בגלל השגיאה בשרת.

האם אפשר להריץ את היישום על המחשב?

כן, הקוד מפורסם תחת רישיון MIT ומבוסס על ספריות פתוחות כמו Gradio ו־Torch. תצטרכו חומרת GPU מתאימה כדי להריץ את מודלי הטורבו והתמונה, וכן להגדיר חיבור מתאים למודל השפה שמייצר את המילים. הקוד עצמו זמין לעיון ולהורדה חופשית.

איך משתמשים

השימוש פשוט: מקלידים תיאור קצר ולוחצים על Generate. לפי התיעוד, גרסת הטורבו מפיקה דקת אודיו בכשתי שניות על כרטיס מסך מתאים, כך שההפקה עצמה אמורה להיות כמעט מיידית. עם זאת, נכון לעכשיו החומרה המוגדרת היא כרטיס zero-a10g והאפליקציה נמצאת במצב של שגיאת ריצה, ולכן אי אפשר להשתמש בה ישירות בדפדפן עד שהמפתח יתקן אותה.

הרישיון

הקוד מפורסם תחת רישיון MIT, שמאפשר שימוש חופשי, העתקה ושינויים לכל מטרה. עם זאת, כדאי לשים לב שנעשה כאן שימוש בכמה מודלים שונים, כמו Ace-Step ו־Z-Image, ולכל אחד מהם עשויים להיות תנאי שימוש משלו לגבי התוצרים המסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗