GPT
A

acestep-captioner

קוד פתוח

ACE-Stepmit2026-01-23

  • transformers
  • safetensors
  • qwen2_5_omni
  • text-to-audio
  • music

המודל מנתח קובצי שמע ומייצר להם תיאור מוזיקלי מילולי ומפורט. הוא מתאים למי שרוצה לתייג ספריות מוזיקה גדולות או לבנות דאטה־סט לאימון מודלים של סאונד.

  • 11Bפרמטרים
  • 20.8 GBמשקל הקבצים
  • 1,595הורדות בחודש
  • 70לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורת Qwen2.5 Omni עם כ־11 מיליארד פרמטרים, שנועד לתת תיאור טקסטואלי מלא של קטעי מוזיקה. הוא יודע לזהות מעל 1,000 סוגי כלי נגינה ושילובים שלהם, סגנונות מגוונים כמו פופ, רוק, ג'אז או מוזיקה מזרח־תיכונית, ולנתח את מבנה השיר, כולל זיהוי של פתיח, בית, פזמון או קליימקס. חוץ מהכלים, הוא גם מתאר את איכות הצליל והמרחב, למשל אם ההקלטה נקייה, עמוסה בהדהוד או חמה.

היוצרים שלו השתמשו בו כדי לתייג את הדאטה עבור פרויקט ACE-Step v1.5, ולטענתם הדיוק שלו במשימות תיאור מוזיקה עוקף את Gemini Pro 2.5. המשמעות בפועל היא שהוא מפיק פסקאות מורכבות שמפרקות את מהלך השיר צעד אחר צעד במקום לזרוק תגיות בודדות, מה שחוסך עבודת תיוג ידנית ומייצר נתונים אחידים.

מתאים ל

  • בניית מאגרי אימון למוזיקה

    מייצר תיאורים עשירים ומדויקים של שמע לצורך אימון מודלים שמייצרים מוזיקה מטקסט.

  • אינדוקס קטלוגים של סאונד

    הופך קובצי מוזיקה לטקסט מפורט עם כלי נגינה וסגנונות, שמאפשר חיפוש חופשי במאגר.

  • ניתוח מבנה לצרכי עריכה

    מזהה רכיבים כמו בתים, פזמונים ושינויי דינמיקה כדי לקטלג קטעים להפקות אודיו.

איפה זה נופל

למרות שהוא מקוטלג תחת text-to-audio, המודל הזה רק מתאר קטעי שמע קיימים ולא מייצר מוזיקה בעצמו. מעבר לכך, הטענה שהוא עוקף את Gemini Pro 2.5 מופיעה בכרטיס ללא פירוט המספרים של מדדי ההשוואה או מבחני ביצועים מלאים, מה שמחייב בדיקה עצמאית על החומרים שלכם.

הוא מתוכנן מראש לייצר פסקאות תיאוריות ועשירות. אם אתם צריכים פלט קצר, זיהוי של שניות בודדות או מידע מובנה כמו JSON, המודל ידרוש עיבוד נוסף כי הוא נוטה להחזיר טקסט חופשי.

שאלות
נפוצות

האם המודל הזה יודע לייצר קובצי מוזיקה?

לא. למרות ההגדרה הטכנית בדף, המודל מקבל קובץ שמע ומחזיר תיאור טקסטואלי בלבד, ולא יודע להפיק צלילים בעצמו.

איזה פרומפט צריך לשלוח לו כדי שיעבוד?

השימוש בו זהה לזה של Qwen2.5 Omni-7B, ושולחים לו פקודה בפורמט קבוע שמבקשת לתאר את השמע בפירוט יחד עם קובץ האודיו.

האם אפשר להשתמש בו ישירות במוצר מסחרי?

כן, רישיון MIT מאפשר שימוש מסחרי חופשי לחלוטין, כל עוד שומרים על הודעת הרישיון המקורית של היוצרים.

איך מריצים

כדי להריץ אותו תצטרכו להוריד 20.8 גיגה־בייט של קבצים בפורמט bfloat16 דרך ספריית transformers. עם כ־11 מיליארד פרמטרים, כרטיס מסך ביתי רגיל יתקשה מאוד להחזיק אותו בזיכרון, ותצטרכו כרטיס עם לפחות 24 גיגה־בייט VRAM, כמו RTX 3090 או A10G, רק כדי לטעון אותו ולהריץ הסקה יציבה.

אופן הפנייה אליו זהה לזה של Qwen2.5 Omni-7B, ומעבירים לו שורת הנחיה פשוטה יחד עם האודיו. אם יש לכם רק כמה קטעים לבדוק פעם בשבוע, התעסקות עם שרת עצמאי בגודל הזה כנראה תעלה יותר זמן וכסף מפתרונות ענן, אבל אם אתם מעבדים מאגרי אודיו ענקיים ברצף, הרצה מקומית משתלמת הרבה יותר.

from transformers import pipeline

pipe = pipeline("text-to-audio", model="ACE-Step/acestep-captioner")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, אחד החופשיים שיש. אפשר לקחת את המשקלים, להשתמש בהם במוצרים מסחריים, לשנות אותם ולשלב אותם כמעט בכל תוכנה שתפתחו. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והרישיון המקורי בקוד או בתיעוד המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗