GPT
M

MiniMax-Music3

קוד פתוח

MiniMaxAIרישיון לא דווח2026-08-07

  • diffusers
  • safetensors
  • minimax_music3
  • music-generation
  • text-to-music

מודל שמייצר שירים מלאים של עד חמש דקות עם שירה ועיבוד לפי מילים ותיאור סגנון. המבנה ההיררכי שלו שומר על רצף מוזיקלי לאורך קטעים ארוכים.

  • 2.4Bפרמטרים
  • 53.4 GBמשקל הקבצים
  • 25,699הורדות בחודש
  • 1,365לייקים

מה זה

הארכיטקטורה כאן מחלקת את העבודה לשניים. מודל שפה גלובלי של 8 מיליארד פרמטרים, שמבוסס על Qwen3-8B, אחראי על המבנה הכללי של השיר, הקצב והנושאים המוזיקליים. לצידו פועל מודל מקומי קטן בהרבה של 0.6 מיליארד פרמטרים שמטפל בפרטים האקוסטיים של כל פריים.

במקום לייצר אודיו ישירות מקודים בדידים, המערכת מחברת את המצבים הנסתרים של שני המודלים ומעבירה אותם דרך רכיב Flow Matching של 2.4 מיליארד פרמטרים ומפענח Flow-VAE. התוצאה הסופית היא קובץ סטריאו ברזולוציה של 32 קילוהרץ ו־16 ביט, שמתפתח בצורה הגיונית מבית לפזמון ולסיום.

מתאים ל

  • הפקת שירים שלמים

    יצירת שירים של עד חמש דקות עם בתים ופזמונים מובחנים לפי מילים ותגיות מבנה.

  • סקיצות מוזיקליות להפקות

    בדיקת כיווני עיבוד וסגנון במהירות על בסיס תיאור טקסטואלי מפורט של כלים ומקצב.

  • מוזיקת רקע מותאמת אישית

    הפקת קטעי אודיו בסטריאו באיכות 32 קילוהרץ לפרויקטים שדורשים התפתחות רגשית מוגדרת.

איפה זה נופל

המודל דורש כרטיס גרפי של NVIDIA עם CUDA, ואין אפשרות להזרים את האודיו בזמן אמת תוך כדי יצירה. אורך היצירה מוגבל ל־9,000 פריימים אקוסטיים, שהם עד חמש דקות בקצב של 25 פריימים לשנייה, והקלט הטקסטואלי מוגבל ל־5,000 תווים מקודדים. בנוסף, ההגדרות של סולם, קצב וכלים בתיאור הטקסט אינן מדויקות באופן אבסולוטי. המודל מנסה להתאים את עצמו לבקשות, אך בפועל הוא עלול לפספס חלק מהמבנה, כלי הנגינה או מילות השיר.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי?

כן, אך זה ידרוש פשרות בביצועים. שימוש בטכניקת פריקת שכבות מאפשר להריץ אותו אפילו על כרטיסים של 8 גיגה-בייט, אך זמן היצירה יהיה ארוך משמעותית ביחס לכרטיס עם 24 גיגה-בייט זיכרון.

האם המודל תומך בהזרמת אודיו בזמן יצירה?

לא. המודל תומך כרגע ביצירה לא-רציפה בלבד, והקובץ מוחזר בשלמותו רק בסיום התהליך.

איך שולטים על מבנה השיר במהלך היצירה?

מזינים את המילים עם תגיות מפורשות כמו בית, פזמון או סיום בכל שורה, ומצרפים תיאור מפורט של הסגנון והכלים.

איך מריצים

כדי להריץ אותו מקומית צריך להוריד 53.4 גיגה-בייט של משקלים ולעבוד בסביבת לינוקס עם תמיכת CUDA בלבד. יש תמיכה בהרצה דרך SGLang-Omni כממשק שרת, דרך ספריית diffusers או בתוך ComfyUI. בדיוק מלא המודל דורש מעל 24 גיגה-בייט זיכרון גרפי, אך עם פריקה אוטומטית למעבד אפשר לרדת לאזור 22 גיגה-בייט, ואפילו לכרטיסי 8 גיגה-בייט באמצעות פריקה מדורגת של שכבות מודל השפה.

אם אתם לא רוצים לתחזק שרת עם חומרה ייעודית, קריאה ל־API הרשמי של MiniMax תחסוך את זמני הטעינה וההורדה הכבדים. ההרצה המקומית מתאימה רק למי שרוצה שליטה מלאה בתהליך ההפקה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("MiniMaxAI/MiniMax-Music3")
img = pipe("a photo").images[0]

הקבצים

88 קבצים במאגר, 53.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד המודל לא דווח רישיון רשמי ומופיע קישור לקובץ חיצוני בלבד. במצב כזה אין אישור שימוש ברור, מה שיוצר סיכון משפטי עבור שילוב המודל במוצר מסחרי עד להבהרת תנאי השימוש ישירות מול MiniMax.

הרישיון המלא בעמוד המודל ↗