GPT
S

Singularity-LTX-2.3_OmniCine_V1

קוד פתוח

WarmBloodAbanapache-2.02026-05-09

  • text-to-video
  • image-to-video
  • ltx-video
  • ltx-2.3
  • lora

התאמה למודל וידאו שמייצרת סרטונים מתמונות עם חלוקה מדויקת של תנועות ומצלמה לפי שניות. הפוקוס כאן הוא שליטה בבימוי בלי עיוותי אצבעות ובלי כתוביות שנצרבות בטעות.

  • 7.7 GBמשקל הקבצים
  • 5,313הורדות בחודש
  • 109לייקים

מה זה

מדובר בכיול עמוק על גבי LTX-Video 2.3 שעבר כמעט 100,000 צעדי אימון כדי לפתור את המחלות הידועות של מודלי וידאו פתוחים. המודל מקבל תמונה והנחיות טקסט ומייצר סרטון, כשהוא מתמקד בשימור מבנה הגוף, תנועה טבעית של אצבעות וחיבור נכון בין תמונת התחלה לתמונת סיום. אפשר להשתמש בתמונת מקור כרפרנס סגנוני ורעיוני ולא רק כפריים ראשון נעול, כך שהמצלמה יכולה לייצר זוויות חדשות לגמרי של אותה דמות.

ההבדל העיקרי מול מודלים אחרים באותו סדר גודל הוא היכולת לפרק את הפרומפט לציר זמן של שניות, למשל הגדרת פעולה ספציפית לשניות 0 עד 3 ותנועת מצלמה שונה לשניות 4 עד 8. הכרטיס מציג שיפור משמעותי בהבעות פנים בזמן דיבור וסנכרון שפתיים, שילוב של סגנונות אנימה, ריאליזם ו־CGI, והעלמה של כתוביות שרופות שהמודל המקורי נטה להדביק על התמונה.

מתאים ל

  • הנפשת דמויות אנימה ואיור

    האימון כלל דאטה ייעודי לאנימה ומאפשר תנועות קרב ודיבור מדויקות בלי לפרק את קווי הדמות.

  • בימוי שוטים מורכבים

    מאפשר הגדרת תנועות מצלמה ופעולות לפי חלוקת שניות מדויקת מתוך תמונת מקור אחת או שתיים.

  • סרטוני דיבור וסנכרון שפתיים

    מספק מימיקת פנים משופרת בזמן דיאלוגים ללא הופעת כתוביות צרובות על המסך.

איפה זה נופל

למרות השליטה בתנועה, המפתח מודה שבתנועות קיצוניות ומורכבות מאוד עדיין מופיע טשטוש תנועה לא רצוי, וכרגע מנסים לפתור את זה בתהליכי עיבוד מאוחרים. בנוסף, המודל מחייב שימוש בתבנית פרומפטים קשיחה מאוד באנגלית לפי שניות וסעיפים, ואם תזרקו לו טקסט חופשי או בעברית כנראה תקבלו תוצאות שבורות. שילוב עברית בדיאלוגים או בטקסטים כלל לא נבדק וסביר שידרוש עבודה נפרדת.

שאלות
נפוצות

האם אפשר לתת לו פרומפטים רגילים כמו במחוללי וידאו אחרים?

עדיף שלא. המודל הזה אומן להגיב למבנה פקודה מאוד מסוים שמחלק את הסצנה לסגנון, פעולה לפי שניות, תנועת מצלמה וסאונד. סטייה מהתבנית הזו תפגע ביכולת שלו לשלוט בדיוק בסצנה.

אפשר להריץ אותו ישירות מקובצי המשקלים שבמאגר?

הקבצים כאן הם התאמה אישית ולא מודל מלא עצמאי לחלוטין. כדי להשתמש בהם תצטרכו להוריד גם את מודל הבסיס LTX-2.3 בגרסת 22B המזוקקת ולהריץ אותם יחד דרך ComfyUI.

איך מריצים

את המשקלים, שתופסים 7.7 ג'יגה בייט ב־34 קבצים, מריצים לרוב דרך תהליך עבודה מוכן של ComfyUI שנמצא בקבצי המאגר. המפתח ממליץ לחבר אותו למודל הבסיס בגרסת ltx-2.3-22b-distilled-1.1 בפורמט fp8 scaled, מה שאומר שתצטרכו כרטיס מסך חזק עם מספיק זיכרון VRAM כדי להחזיק מודל של 22 מיליארד פרמטרים לצד קובצי ההתאמה.

אם אין לכם חומרה כבדה מקומית או שרת ייעודי, קיים דמו מקוון בענן בשירות RunningHub. מי שמחפש רק לבדוק תנועה או לייצר קטעים בודדים יחסוך הרבה התעסקות בהגדרות מקומיות אם יריץ את זה דרך שירות ענן.

pip install -U huggingface_hub
hf download WarmBloodAban/Singularity-LTX-2.3_OmniCine_V1

הקבצים

34 קבצים במאגר, 7.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה חופשית, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗