GPT
S

SoulX-FlashHead-1_3B

קוד פתוח

Soul-AILabapache-2.02026-02-11

  • diffusers
  • safetensors
  • wan
  • image-to-video

הנפשת תמונות ראש מדברות בסטרימינג חי, עם דגש על ביצועים מהירים במיוחד שמאפשרים תגובה בזמן אמת על חומרת קצה.

  • 13.3 GBמשקל הקבצים
  • 1,970הורדות בחודש
  • 62לייקים

מה זה

הארכיטקטורה מבוססת על WanVideoModel ומיועדת ליצירת וידאו מתמונה יחידה וקובץ קול, בדגש על אנימציית פנים מסונכרנת דיבור. המפתחים בנו את הפתרון סביב תהליכי זיקוק שמאפשרים הפקת פריימים במהירות חריגה ביחס למקובל במודלי דיפוזיה, לצד שילוב רכיבי עיבוד כמו ה־VAE של LTX-Video בגרסה הקלה.

ההבדל המרכזי מול מתחרים בקטגוריית הגודל הזו הוא היכולת לייצר סטרימינג רציף ללא הגבלת זמן. גרסת Lite מגיעה לקצב של 96 פריימים בשנייה על כרטיס RTX 4090 יחיד, או לחלופין שלושה ערוצי שידור מקבילים בזמן אמת של מעל 25 פריימים בשנייה, בעוד גרסת Pro מתמקדת באיכות תמונה גבוהה יותר ומספקת כ־10.8 פריימים בשנייה על אותו כרטיס.

מתאים ל

  • סוכני שירות אינטראקטיביים

    גרסת Lite מאפשרת יצירת אווטאר מדבר בזמן אמת עם השהיה נמוכה במיוחד על חומרה מקומית נגישה.

  • הנפשת דמויות לשידור חי

    תמיכה בסטרימינג רציף ללא מגבלת זמן מאפשרת הזנת דיבור חי ישירות לתוך תמונת דמות קבועה.

  • עיבוד וידאו באיכות גבוהה

    גרסת Pro מפיקה פריימים באיכות משופרת כשהמערכת אינה מוגבלת לדרישת זמן אמת מיידית.

איפה זה נופל

כדי להגיע למהירות עבודה בזמן אמת בגרסת Pro נדרשת חומרה מתקדמת מאוד בדמות זוג כרטיסי RTX 5090, שאינם זמינים או נגישים לכל צוות פיתוח. ההתקנה מורכבת ודורשת קומפילציה ידנית של ספריות האצה ספציפיות שלא תמיד עוברות חלק בסביבות שונות, ובנוסף משקלי גרסת הבסיס טרם שוחררו למחקר והתאמה אישית.

שאלות
נפוצות

האם המודל דורש תלויות חיצוניות נוספות מלבד המשקלים שלו?

כן, תהליך העיבוד מחייב הורדה נפרדת של מודל האודיו wav2vec2-base-960h כדי לפענח את הקול לפני הדיפוזיה. בנוסף, חובה להתקין את כלי המערכת FFmpeg וספריות האצה ייעודיות כמו FlashAttention.

מה ההבדל המעשי בבחירה בין גרסת Lite לגרסת Pro?

גרסת Lite מיועדת למהירות קיצונית ומאפשרת להריץ עד שלושה ערוצי שידור חי על כרטיס RTX 4090 יחיד. גרסת Pro מציעה איכות ויזואלית גבוהה יותר, אך דורשת שני כרטיסי RTX 5090 כדי לעבוד בזמן אמת.

איך מריצים

ההרצה המקומית דורשת סביבת לינוקס, פייתון 3.10, PyTorch 2.7.1 עם CUDA 12.8, התקנת FFmpeg וחבילות האצה כמו FlashAttention או SageAttention. בנוסף לקבצי המודל עצמם, הצינור תלוי בהורדה מקבילה של מודל האודיו wav2vec2-base-960h מבית פייסבוק לעיבוד הקול.

גרסת Lite תרוץ מעולה בזמן אמת על כרטיס צרכני יחיד מסוג RTX 4090. אם אתם רוצים את איכות התמונה של גרסת Pro בזמן אמת מלא של מעל 25 פריימים בשנייה, תצטרכו מערך של שני כרטיסי RTX 5090 עם SageAttention, כך שעבור עומסי עבודה כבדים או משתמשים ללא חומרה ייעודית כזו, שירות ענן מרוחק יהיה פשוט בהרבה לתחזוקה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("Soul-AILab/SoulX-FlashHead-1_3B")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בקוד ובמשקלים לצרכים מסחריים, לשנות אותם ולהפיץ אותם בתוך מוצרים, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗