GPT
M

MOSS-SoundEffect-v2.0

קוד פתוח

OpenMOSS-Teamapache-2.02026-05-25

  • diffusers
  • safetensors
  • text-to-audio
  • diffusion
  • flow-matching

מודל ליצירת אפקטים קוליים וסביבות שמע מטקסט, שמפיק קבצים של עד 30 שניות באיכות 48kHz. הוא מתאים למי שצריך סאונד מותאם אישית למשחקים או וידאו בלי להסתמך על מאגרים קבועים מראש.

  • 1.4Bפרמטרים
  • 10.5 GBמשקל הקבצים
  • 1,213הורדות בחודש
  • 138לייקים

מה זה

הארכיטקטורה כאן מחליפה את המנגנון האוטו-רגרסיבי הישן בטרנספורמר דיפוזיה עם Flow Matching, לצד מקודד טקסט של Qwen3 ורכיב DAC VAE. השילוב הזה מתרכז ביצירת צלילים שאינם דיבור, כמו רעשי רקע עירוניים, תנועות אנושיות, בעלי חיים וקטעי מוזיקה קצרים. עם 1.4 מיליארד פרמטרים, הוא מתמודד ישירות עם משימת יצירת האודיו הרציף תוך שליטה באורך הפלט לפי דרישה.

בניגוד לכלים רבים שמוגבלים לשניות ספורות ומתקשים לשמור על אחידות, כאן אפשר להגדיר משך זמן של עד חצי דקה בכל ריצה. המודל אומן על תיאורים באנגלית ובסינית בלבד, כך שהבנת השפה מוגבלת אליהן, אך מגוון הסצנות הקוליות שהוא מכסה רחב יחסית לגודלו. איכות הדגימה הגבוהה של 48kHz מבטיחה תוצאה חדה שמתאימה להפקה ישירה.

מתאים ל

  • סאונד למשחקי מחשב

    יצירת רעשי רקע, צעדים ואפקטים סביבתיים מותאמים אישית לשלבים לפי תיאור טקסטואלי.

  • פוסט פרודקשן לווידאו

    הפקת שכבות שמע ואמביינס של עד חצי דקה כדי למלא חללים שקטים בצילומי חוץ ופנים.

  • אפקטים קוליים לפודקאסטים

    יצירת קטעי מעבר מוזיקליים קצרים ורעשי אווירה בלי להסתבך עם זכויות יוצרים של מאגרים.

איפה זה נופל

המודל אינו תומך בהנחיות בעברית, וניסיון לכתוב פרומפטים בשפה שאינה אנגלית או סינית יניב ככל הנראה תוצאות לא צפויות. מעבר לזה, תהליך ההיסק דורש 100 צעדים ומספק עומס חישובי ממשי שלא יתאים ליצירת צלילים בזמן אמת בתוך משחק, אלא רק לעיבוד מראש. הכרטיס גם מציין אפשרות לתקלות עם Triton ו־TorchDynamo, מה שעלול לחייב ביטול אופטימיזציות והאטה נוספת.

אותה משפחה

MOSS-SoundEffect יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לתת למודל הנחיות בעברית?

לא. המודל אומן על אנגלית וסינית בלבד. כדי להפיק צלילים מדויקים תצטרכו לכתוב את הפרומפטים באחת משתי השפות האלה.

האם המודל מייצר דיבור או שירה?

הכלי הזה מיועד לאפקטים קוליים, רעשי סביבה וקטעים מקצביים בלבד. הוא אינו מיועד להקראת טקסט או לדיבור אנושי מובן.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך מודרני שתומך ב־bfloat16 וב־CUDA, יחד עם התקנה נקייה של פייתון 3.12. המודל שוקל 10.5 גיגה-בייט, ומאחר שהוא כולל הידור עם Triton ו־torch.compile, הריצה הראשונה תיקח כמה דקות של המתנה עד לסיום הקומפילציה.

ברירת המחדל דורשת מאה צעדי היסק להפקה של קובץ יחיד. אם השרת שלכם חלש או חסר מעבד גרפי מתאים, הריצה המקומית תהיה איטית מאוד, ואז עדיף לשקול עבודה מול שירות חיצוני מרוחק שמריץ את המשקלים עבורכם.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("OpenMOSS-Team/MOSS-SoundEffect-v2.0")
img = pipe("a photo").images[0]

הרישיון

רישיון Apache 2.0 מאפשר שימוש חופשי, כולל הפצה, שינוי קוד ושילוב במוצרים מסחריים. אין חובה לחשוף את הקוד שלכם, וצריך רק לשמור על תנאי הרישיון המקוריים והצהרות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗