GPT
S

scenema-audio

קוד פתוח

ScenemaAIother2026-04-26

  • scenema-audio
  • audio-generation
  • diffusion
  • text-to-audio
  • voice-cloning

מודל דיבור שמתמקד במשחק קולי, שליטה בנשימות ורגשות דרך תגיות טקסט. הוא נבנה על בסיס מודל הווידאו של לייטריקס ומאפשר שכפול קול ישירות מדגימה קצרה.

  • 21.8 GBמשקל הקבצים
  • 127הורדות בחודש
  • 147לייקים

מה זה

המודל הזה לוקח טקסט בפורמט דמוי תסריט ומייצר קובץ אודיו בסטריאו של 48 קילוהרץ, שכולל לא רק את המילים אלא גם הוראות בימוי כמו צעקה, לחישה או בכי. בבסיס שלו יושב שנאי דיפוזיה שחולץ ממודל LTX 2.3 של לייטריקס, לצד מקודד טקסט מסוג ג׳מה 3 בנפח 12 מיליארד פרמטרים, מודל ווקובר והפרדת צלילים, ומערכת SeedVC להעברת זהות קולית. הוא תומך גם בהוספת רעשי רקע של סביבה לפי תיאור טקסטואלי, ומסוגל לחקות קולות של ילדים בלי להישמע כמו מבוגר עם פיץ' מוגבה.

בניגוד לכלי הקראה רגילים שמפיקים קריינות שטוחה ורציפה, כאן הדיבור מחולק למקטעים של עד 15 שניות שמחוברים יחד אוטומטית בעזרת הערכת זמנים מבוססת קוקורו. על כרטיס RTX 4090 עם 24 גיגה זיכרון, שילוב של גרסת INT8 עם מודל שפה מקוונטט מייצר 55 שניות של אודיו בתוך 35 שניות, כלומר קצב מהיר מזמן אמת ביחס של 1.57. אם מריצים באיכות bf16 מלאה, התהליך לוקח 83 שניות ומאט מתחת לזמן אמת.

מתאים ל

  • דיבוב משחקים וסצנות

    יצירת דיאלוגים מורכבים עם צעקות, לחישות ושינויי מצב רוח לפי הוראות בימוי מפורטות בתוך הטקסט.

  • שכפול קולות לדמויות

    הלבשת זהות קולית מדגימה קצרה של 10 שניות על ביצועים דרמטיים שלא הוקלטו מעולם על ידי הדובר המקורי.

  • הפקת פודקאסטים עלילתיים

    יצירת קריינות שכוללת אפקטים וסאונד של סביבה כמו גשם או המולת רחוב ישירות מאותו התיאור.

איפה זה נופל

המודל נוטה לשבש מילים ארוכות מרובות הברות ושמות פרטיים. בנוסף, חלון היצירה מוגבל ל־15 שניות בלבד לכל מקטע, כך שטקסט ארוך נחתך ומחובר, מה שעלול לייצר תפרים שמיעים. בעת שכפול קול, שמירה על זהות הדובר מקהה לעיתים את הקצוות הרגשיים ודורשת דגימת מקור נקייה מאוד עם גיוון טבעי כדי לא להישמע שטוחה. עברית אינה מופיעה ברשימת השפות הנתמכות, ומעבר בין שפות באותו משפט גורם לסחיפה פונטית ושיבושים קשים בדיבור.

שאלות
נפוצות

האם אפשר להריץ את המודל כדי לייצר דיבור בעברית?

המודל תומך רשמית באנגלית, גרמנית, צרפתית, ספרדית, איטלקית, פורטוגזית, יפנית, סינית ועוד כמה שפות נבחרות, אך עברית אינה ברשימה. ניסיון להזין טקסט בעברית צפוי להפיק ג'יבריש או הגיות שגויות לחלוטין.

איזה כרטיס מסך מינימלי דרוש כדי שהמודל יעבוד בצורה שמישה?

אפשר להריץ על כרטיס של 16 גיגה, אך הביצועים יהיו איטיים מאוד בגלל העברת קידוד הטקסט למעבד. בפועל דרוש כרטיס עם 24 גיגה זיכרון וידאו כמו RTX 3090 או 4090 כדי להריץ הכל על המעבד הגרפי ולקבל קצב עבודה מהיר מזמן אמת.

למה המערכת מחייבת טוקן של האגינג פייס כדי לעלות?

שרשרת העיבוד משתמשת במודל ג׳מה 3 של גוגל לצורך הבנת הטקסט והוראות הבימוי. מאחר ומדובר במודל סגור הדורש הסכמה לתנאי שימוש באתר האגינג פייס, אי אפשר למשוך את המשקלים שלו בצורה אנונימית.

איך מריצים

ההפעלה המקומית נעשית בעיקר דרך דוקר קומפוז שמוריד כ־38 גיגה של מודלים בהפעלה הראשונה. כדי לקבל ביצועים סבירים צריך כרטיס מסך עם לפחות 24 גיגה זיכרון וידאו, מה שמאפשר להחזיק את מודל האודיו בגרסת INT8 ואת ג׳מה בזיכרון הכרטיס. אם יש לכם רק 16 גיגה זיכרון וידאו, המערכת תזרים את מודל השפה דרך המעבד הראשי ותדרוש 32 גיגה זיכרון מערכת, אבל זמני הקידוד יזנקו משבריר שנייה לכשבע שניות לכל מקטע.

למי שאין כרטיס מסך חזק או תחנת עבודה ייעודית, עדיף להשתמש בשרת מרוחק או ב־API. ההרצה דורשת גם טוקן של האגינג פייס עם אישור גישה מראש למודל ג׳מה 3 של גוגל, כך שאי אפשר פשוט להוריד ולהריץ בלי תלות חיצונית בחשבון מאושר.

pip install -U huggingface_hub
hf download ScenemaAI/scenema-audio

הרישיון

משקלי המודל משוחררים תחת רישיון הקהילה של LTX-2 בגלל התלות במודל הבסיס של לייטריקס. קוד ההרצה והשרת זמינים ברישיון MIT חופשי, אך מקודד הטקסט ג׳מה 3 כפוף לתנאי השימוש הנפרדים והמוגבלים של גוגל שמחייבים הרשמה מראש.

הרישיון המלא בעמוד המודל ↗