GPT
S

SoulX-FlashTalk-14B

קוד פתוח

Soul-AILabapache-2.02026-01-08

  • diffusers
  • safetensors
  • i2v
  • portrait-animation
  • real-time

הכלי מפיק וידאו של דמות מדברת מתוך תמונה בודדת וקובץ אודיו, עם דגש על שידור מתמשך. אם אתם מחפשים סנכרון שפתיים בזמן אמת לאווטארים, זו אחת האפשרויות הפתוחות הבודדות בתחום.

  • 19Bפרמטרים
  • 50.7 GBמשקל הקבצים
  • 1,147הורדות בחודש
  • 45לייקים

מה זה

מדובר במודל שמייצר וידאו לפי תמונה ושמע, המבוסס על שילוב של מודלים קודמים כמו Wan וטכניקות זיקוק ידע. המטרה שלו היא לאפשר הזרמה אינסופית של דמות שמדברת ומגיבה לקול ברצף, בלי לחתוך קטעים מראש. לפי המפתחים הוא מתמודד עם דיבור רגיל, ראפ מהיר ואפילו אנימציה של חיות.

למרות שהשם כולל 14B, בפועל יש כאן קרוב ל־19 מיליארד פרמטרים. ההבדל המשמעותי לעומת מודלים אחרים ליצירת וידאו הוא הארכיטקטורה שמיועדת להזרמה בזמן אמת, אבל המימוש הנוכחי עדיין כבד מאוד ודורש מערך שרתים רציני כדי להגיע לביצועים האלה בפועל.

מתאים ל

  • נציגי שירות וירטואליים

    יצירת אווטאר שמגיב בזמן אמת לשמע מול לקוחות, בתנאי שיש תשתית שרתים של שמונה כרטיסי H800.

  • הנפשת תמונות סטילס

    הפקת סרטונים קצרים מתמונות פורטרט או דמויות מאוירות על גבי קובץ קריינות קיים, ללא דרישת זמן אמת.

  • הפקת תוכן מוזיקלי

    סנכרון שפתיים מהיר ומדויק יותר לקטעי היפ הופ או שירה בקצב גבוה לפי דוגמאות הפיתוח.

איפה זה נופל

החיסרון המרכזי הוא דרישות החומרה הקיצוניות שהופכות הפעלה עצמית לבלתי נגישה לרוב המפתחים. בנוסף, המודל מסתמך על רכיב wav2vec2 שאומן בסינית, מה שמעלה סימני שאלה גדולים לגבי דיוק סנכרון השפתיים בשפות אחרות כמו עברית, שלא נבדקה כלל בתיעוד. אין כרגע דמו רשת עובד שמאפשר לבדוק את האיכות לפני שמורידים 50 ג'יגה בייט של קבצים ומרימים תשתית ענן יקרה.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס RTX 4090 בודד?

לא. המודל דורש מעל 64GB של VRAM להרצה בסיסית על כרטיס בודד, כך שהוא לא יעלה על כרטיס ביתי של 24GB. גרסה מותאמת לכרטיסים צרכניים הובטחה על ידי הצוות אך טרם שוחררה.

האם סנכרון השפתיים עובד טוב בעברית?

הכרטיס מציג תמיכה רשמית באנגלית ומסתמך על מודל שמע סיני של טנסנט. עברית לא מוזכרת ולא נבדקה בפרויקט, כך שסביר להניח שיהיו פערי דיוק בהגייה ובתנועות הפה.

איך אפשר לבדוק את התוצאות בלי לשכור שרת יקר?

כרגע אין דמו רשת פעיל והאפשרות היחידה לבחון את המודל היא להוריד את המשקלים ולהריץ את הקוד עצמאית. מומלץ לעקוב אחרי עמוד הפרויקט ולחכות לקישור של ה־Hugging Face Space כשיעלה.

איך מריצים

כרטיס יחיד ידרוש יותר מ־64GB של זיכרון גרפי רק כדי להריץ אינפרנס בסיסי, כך שכרטיסים ביתיים מחוץ לתמונה כרגע. אם המטרה היא ביצועים בזמן אמת, המפתחים מציינים במפורש שצריך אשכול של 8 כרטיסי H800 ומעלה. בנוסף למודל עצמו צריך להוריד מודל עזר לעיבוד שמע של טנסנט, ששוקל קבצים נוספים.

המפתחים הבטיחו גרסה מותאמת לארבעה מעבדים גרפיים וגרסה עתידית לכרטיסי RTX 4090, אבל כרגע הן לא זמינות. אם אין לכם גישה לשרת ייעודי עם חומרה ברמת מרכז נתונים, אין דרך מעשית להריץ אותו עצמאית לייצור.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Soul-AILab/SoulX-FlashTalk-14B")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה של המודל כחלק ממוצר סגור. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗