GPT
A

ACE-Step-1.5-GGUF

קוד פתוח

Serveurpersomit2026-02-20

  • gguf
  • music-generation
  • text-to-music
  • ggml
  • cpp

גרסת GGUF יעילה למודל המוזיקה שמייצר רצועות סטריאו ב־48kHz מטקסט ומילים. מתאים למי שרוצה להריץ הפקת אודיו מקומית על מעבד או כרטיס מסך בלי להסתבך עם פייתון כבד.

  • 200 GBמשקל הקבצים
  • 310,732הורדות בחודש
  • 92לייקים

מה זה

המאגר הזה מכיל המרות של ACE-Step 1.5 לסביבת acestep.cpp מבוססת GGML, מה שמאפשר להריץ את כל הצינור ב־C++17 על גבי CUDA, מעבדים רגילים, Metal או Vulkan. הארכיטקטורה מורכבת מכמה חלקים שעובדים יחד, מקודד טקסט של Qwen3, מודל שפה שמייצר מילים וקודי אודיו בקצב של 5Hz, ומודל דיפוזיה מסוג DiT שמתרגם את הקודים לרצועת שמע מלאה דרך VAE.

ההבדל המשמעותי כאן הוא הפיצול בין המודלים והכימות המוקדם. יש כאן מודלי שפה בגדלים של 0.6B, 1.7B ו־4B, יחד עם גרסאות DiT בגודל 2B או 4B XL. גרסאות הטורבו דורשות שמונה צעדים בלבד כדי לייצר סאונד, בעוד שגרסאות ה־SFT והבסיס דורשות 32 עד 50 צעדים ומיועדות למי שמחפש תוצאה עשירה יותר על חשבון מהירות.

מתאים ל

  • הפקת מוזיקה וסקיצות מקומית

    יצירת שירים מלאים עם מילים וסאונד סטריאו 48kHz ישירות על המחשב בלי תלות בשירותי ענן בתשלום.

  • עיבוד גרסאות כיסוי

    שימוש במצבי הכיסוי המובנים כדי להלביש גוון קול חדש על אודיו מקור דרך מקודד ה־VAE.

  • שילוב במערכות הפעלה מגוונות

    הרצה קלת משקל על חומרות מגוונות ממעבדים ועד Metal בזכות מימוש עצמאי לחלוטין ב־C++17.

איפה זה נופל

המודל תומך רשמית בשמונה שפות בלבד, ביניהן אנגלית, צרפתית, סינית ויפנית, אך עברית אינה ברשימה. מודל השפה של 4B לא כולל כימות אגרסיבי של Q4_K_M כי הוא שובר את יצירת קודי האודיו, ובמודלים הקטנים יותר של 0.6B ו־1.7B אין כימות מתחת ל־Q8_0 מאותה סיבה בדיוק. בנוסף, מקודד הטקסט נעול ארכיטקטונית לגודל 0.6B, כך שאי אפשר לשדרג אותו בנפרד בלי לשבור את החיבור למודל הדיפוזיה.

שאלות
נפוצות

האם צריך להוריד את כל 200 הגיגה בייט של המאגר?

ממש לא. המאגר כולל עשרות שילובים שונים של גדלים ורמות כימות. להרצה ראשונית מורידים רק את חבילת הטורבו הבסיסית שתופסת בערך 7.7GB ומכילה את כל מה שצריך כדי להפיק מוזיקה.

האם המודל מסוגל לשיר ולייצר מוזיקה בעברית?

השפות המדווחות במודל כוללות רק אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, סינית, יפנית וקוריאנית. עברית לא נתמכת רשמית ולכן טקסטים בעברית עלולים להניב הגייה משובשת או להיכשל לחלוטין.

איך מריצים

בשביל הרצה בסיסית מורידים את הפרויקט בגיטהאב, מקמפלים בעזרת CMake עם תמיכה בחומרה שלכם, ומריצים את הסקריפט שמוריד את חבילת הטורבו הבסיסית בנפח של בערך 7.7GB בכימות Q8_0. השרת המובנה מעלה ממשק דפדפן מקומי שמאפשר להזין הנחיות, לטעון מודלים לפי דרישה ולהוריד את הקבצים. יש גם כלי שורת פקודה נפרדים למי שמעדיף לפצל בין שלב יצירת הקודים לסינתזה.

למרות שהמאגר כולו שוקל 200GB בגלל עשרות גרסאות וכימותים, בפועל בוחרים רק קומבינציה אחת. אם אתם רצים על מעבד או חומרה חלשה, שילוב של מודל שפה 0.6B או 1.7B יחד עם DiT 2B מכומת ל־Q4_K_M או Q5_K_M ייכנס גם בכרטיסים עם 6GB עד 8GB זיכרון. לכרטיסים חזקים יותר אפשר לקחת את גרסאות ה־4B בכימות מלא.

ollama run hf.co/Serveurperso/ACE-Step-1.5-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

65 קבצים במאגר, 200 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗