GPT
S

stable-audio-3-optimized

קוד פתוח

stabilityaiother2026-05-18

  • stable-audio-3
  • tflite
  • onnx
  • audio-generation
  • music

גרסה מואצת של מודל יצירת האודיו שמפיקה מוזיקה וצלילים בכמה שניות. היא מיועדת למי שצריך הרצה מהירה מקומית על חומרה ספציפית במקום לחכות לעיבוד ארוך.

  • 128 GBמשקל הקבצים
  • 8,215הורדות בחודש
  • 43לייקים

מה זה

מדובר במודל דיפוזיה שמייצר קטעי שמע באורכים משתנים לפי טקסט באנגלית, כולל עריכה ממוקדת באמצעות אינפיינטינג והמשך הקלטות קצרות. המערך נשען על מקודד שמכווץ את האודיו למרחב לטנטי, יחד עם אימון אדברסריאלי שמקצר את מספר צעדי הדגימה הנדרשים בלי לפרק את איכות הסאונד.

בניגוד למודלים שמאלצים אתכם לייצר תמיד בלוק זמן מלא ויקר, כאן אפשר להגדיר אורך גמיש ולחסוך זמן חישוב יקר על אפקטים של שניות בודדות. הביצועים בפועל מכוונים למהירות גבוהה, עם הפקה בפחות משתי שניות על כרטיס H200 או כמה שניות בודדות על מחשב נייד עם מעבד M4.

מתאים ל

  • ייצור אפקטים קצרים למשחקים

    יצירה גמישה של סאונד באורך מוגדר מראש בלי לשלם על זמן חישוב של קטע מלא.

  • עריכת סאונד והשלמת קטעים

    שימוש ביכולות האינפיינטינג כדי להמשיך הקלטות קיימות או לתקן חלקים פגומים.

  • בדיקות ביצועים מקומיות

    הרצה מהירה על מעבדי אפל M4 או חומרת שרת ספציפית לצורך בדיקת זמני תגובה.

איפה זה נופל

המאגר כולל צ'קפוינטים ניסיוניים בלבד ולא גרסה רגילה ויציבה לשימוש כללי. הוא עובד רק עם פרומפטים באנגלית שמתווכים דרך מודל הטקסט T5Gemma, כך שעברית לא נתמכת כאן בכלל. בנוסף, חומרי האימון סוננו בקפדנות כדי להוציא זכויות יוצרים, מה שאומר שהמודל מוגבל לדאטהסטים כמו Freesound וקטעים מורשים, ולא בהכרח יכיר סגנונות מורכבים שנפוצים במוזיקה מסחרית מוכרת.

שאלות
נפוצות

האם כדאי להוריד את המאגר הזה לשימוש רגיל במוצר?

לא. היוצרים מציינים במפורש שמדובר בקבצים ניסיוניים שמיועדים להאצה בחומרה מסוימת. אם אתם רוצים מודל יציב, הם ממליצים להוריד את Stable Audio 3 Medium במקום להתעסק עם 128 גיגהבייט של קבצים מפוצלים.

האם אפשר להשתמש במודל בעברית?

המודל מוגדר ומאומן באנגלית בלבד, ומשתמש במודל T5Gemma לפענוח הפרומפטים. טקסט בעברית לא ייתן תוצאות צפויות ותצטרכו לתרגם את ההוראות שלכם לאנגלית לפני השליחה.

איך מריצים

בשביל להריץ את המודל תצטרכו את הספרייה הייעודית stable-audio-3 או את כלי המחקר שלהם. יש גם אופטימיזציה למעבדים רגילים דרך סביבת TFLite וגרסאות מקודד מכוונות w8a8, שמחייבות התקנה של ספריית ai_edge_litert מגרסה 2.2.0 ומעלה כדי לשמור על זיכרון יציב.

המאגר שוקל 128 גיגהבייט ומכיל 173 קבצים של נקודות ביקורת ניסיוניות לחומרה מסוימת. אם אתם לא מכוונים להאצה ספציפית או שאין לכם שרת ייעודי חזק, המפתחים עצמם מפנים לגרסת המדיום הרגילה, ולרוב יהיה פשוט וזול יותר לפנות לנקודת קצה מנוהלת במקום להוריד את כל הנפח הזה.

pip install -U huggingface_hub
hf download stabilityai/stable-audio-3-optimized

הקבצים

173 קבצים במאגר, 128 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר תחת תנאי הקהילה של Stability AI ולא כקוד פתוח חופשי לחלוטין. שימוש מסחרי מחייב כניסה להסכם רישוי מולם לפי התנאים באתר שלהם. בנוסף, רכיב עיבוד הטקסט משתמש במודל T5Gemma הכפוף לתנאי השימוש הנפרדים של Gemma.

הרישיון המלא בעמוד המודל ↗