GPT
S

Step-Audio-EditX

קוד פתוח

stepfun-aiרישיון לא דווח2025-10-29

  • onnx
  • safetensors
  • step1
  • custom_code

מודל אודיו של 3.5 מיליארד פרמטרים שמתמקד בעריכת קול, רגשות וסגנונות דיבור. במקום רק להקריא טקסט מאפס, הוא מאפשר לשנות נימה או להוסיף אנחות והיסוסים לקובץ קיים.

  • 3.5Bפרמטרים
  • 32,768טוקנים בהקשר
  • 7.7 GBמשקל הקבצים
  • 4,849הורדות בחודש

מה זה

המודל פותח סביב עריכה איטרטיבית של אודיו באמצעות למידת חיזוק, ולא רק יצירה פשוטה מטקסט. הוא מקבל קובץ קול ומאפשר לשנות בו רגש כמו פחד או כעס, לשנות את סגנון הדיבור ללחישה או דיווח חדשותי, ולהוסיף צלילים אנושיים כמו צחוק, נשימות ושיעול לפי תגיות מוגדרות בטקסט.

השפות הנתמכות לפי הכרטיס הן מנדרינית, אנגלית, ניבים סיניים כמו סצ'ואנז וקנטונזית, ובגרסאות מאוחרות יותר נוספו יפנית וקוריאנית. עברית לא מוזכרת שם בכלל. בנוסף לעריכה, הוא יודע לבצע שכפול קול באפס דוגמאות ומספק שליטה בהגייה של מילים בעלות כמה משמעויות בסינית דרך תעתיק פין יין.

מתאים ל

  • עריכת נימת דיבור באנגלית

    שינוי הבעת הפנים הקולית של קריינות קיימת ללחישה או דיבור סמכותי, בעזרת עשרות תגיות סגנון מוכנות.

  • הוספת תגובות אנושיות לקול

    הכנסת אלמנטים כמו צחוק, אנחה, היסוס או נשימה מתוזמנת לתוך טקסט שממירים לדיבור כדי שיישמע חי יותר.

  • שכפול קול בשפות אסייתיות

    הפקת דיבור מאופס דוגמאות במנדרינית, יפנית או קוריאנית עם שליטה מדויקת בהגייה של סימנים מורכבים.

איפה זה נופל

היוצרים מדגישים שביצועי המודל נשמרים רק עבור מקטעי אודיו של עד 30 שניות בכל הרצה, כך שהוא לא בנוי לעיבוד רציף של שיחות ארוכות או פודקאסטים שלמים בלי חיתוך מוקדם.

מבחינת שפות, אין שום תמיכה בעברית, כך שעבור תוצרים מקומיים אין לו שימוש ישיר. מעבר לזה, כדי להפעיל אותו נדרש מודל נפרד בשם טוקנייזר אודיו, והורדת רעשים או הסרת מילות היסוס עדיין לא נתמכות באופן מלא או נמצאות ברשימת הפיתוח העתידי.

שאלות
נפוצות

האם אפשר לערוך איתו הקלטות בעברית?

לא. המודל תומך לפי הכרטיס במנדרינית, אנגלית, ניבים סיניים מסוימים, יפנית וקוריאנית. אין לו אימון או תמיכה בטקסטים ודיבור בעברית.

איזה כרטיס מסך צריך כדי להריץ אותו מקומית?

למודל המלא בגרסת bfloat16 נדרש כרטיס עם לפחות 12 גיגה בייט זיכרון גרפי, כאשר 16 גיגה בייט נחשבים לבטוחים יותר לעבודה. אם המשאבים מוגבלים, קיימת גרסת ארבעה ביט שמסתפקת בערך ב־6 עד 8 גיגה בייט.

האם מותר לשלב אותו באפליקציה מסחרית?

כרגע לא כדאי להסתמך עליו במוצר מסחרי, כי המפתחים לא ציינו שום רישיון בעמוד הפרויקט. בלי תנאי רישוי כתובים וברורים, אין היתר משפטי רשמי לשימוש מסחרי.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של אנבידיה עם תמיכה בקיודה ומערכת לינוקס. לפי הדרישות הרשמיות, צריך לפחות 12 גיגה בייט של זיכרון גרפי עבור המודל המלא, אם כי 16 גיגה בייט מומלצים יותר ליציבות. קיים גם צ'קפוינט מכווץ של ארבעה ביט שדורש סביב 6 עד 8 גיגה זיכרון גרפי ומאפשר ריצה על כרטיסים צנועים יותר.

סביבת הריצה דורשת פייתון 3.12 ומעלה וגרסת פייטארץ' עדכנית, וישנה תמיכה בהאצה דרך וי אל אל אם או קונטיינר דוקר מוכן. אם אתם צריכים רק בדיקה מזדמנת בלי להחזיק שרת דולק, עדיף להשתמש בסטודיו שלהם או לגשת לנקודת הקצה בתשלום דרך הפלטפורמה של החברה.

pip install -U huggingface_hub
hf download stepfun-ai/Step-Audio-EditX

הרישיון

היוצרים לא דיווחו על רישיון שימוש בקבצי המודל. מבחינה משפטית, היעדר רישיון מפורש משאיר את זכויות היוצרים בידיהם במלואן, מה שאומר שאין לכם היתר חוקי להשתמש בו במוצר מסחרי או להפיץ אותו. כל עוד לא יפורסם רישיון קוד פתוח מוכר, הריצה מתאימה רק למחקר מקומי וניסויים.

הרישיון המלא בעמוד המודל ↗