GPT
L

multimodalart/LongCat-Video

רץ בדפדפן

multimodalartרישיון לא דווח2025-10-27

  • gradio

מייצר סרטוני וידאו קצרים באורך 6 שניות מטקסט או מתמונה קיימת. מיועד ליוצרים ומפתחים שרוצים לבדוק את היכולות של המודל של Meituan בלי להתקין סביבת הרצה כבדה במחשב.

  • הורדות בחודש
  • 177לייקים

מה זה

החלוקה כאן ברורה בין שתי לשוניות: יצירת וידאו מטקסט, או יצירת וידאו מתמונה יחד עם הנחיה טקסטואלית. מזינים תיאור באנגלית, בוחרים אם להעלות תמונה, ומקבלים קובץ וידאו מרונדר באורך של 6 שניות. בהגדרות המתקדמות אפשר לקבוע פרומפט שלילי, סיד קבוע, ומידות רוחב וגובה בין 256 ל־1024 פיקסלים, או לבחור רזולוציה של 480p או 720p בתמונה לווידאו.

מאחורי הקלעים רץ המודל LongCat-Video של Meituan עם 13.6 מיליארד פרמטרים. הארכיטקטורה משלבת מודל Transformer תלת ממדי (DiT), מקודד טקסט UMT5, רכיב AutoencoderKLWan ומתזמן FlowMatchEulerDiscrete. הקוד מאפשר לבחור בין מצב Distill מהיר שמוריד מעט מאיכות הבסיס, לבין מצב Refine שמשתמש בזיקוק בשלב הראשון ומספק תוצאה חדה ומפורטת יותר במחיר של זמן יצירה ממושך.

מתאים ל

  • הנפשת תמונות סטילס

    מעלים תמונה, מוסיפים תיאור תנועה קצר ומקבלים קטע וידאו מונפש של שש שניות ברזולוציה של עד 720p.

  • בדיקת פרומפטים לטקסט לווידאו

    מזינים תיאור סצנה כדי לבחון איך המודל של Meituan מפרש תנועה ומצלמה ביחס למודלים מקבילים.

  • הפקת קטעי וידאו קצרים לרשת

    יצירת קבצי וידאו קלילים של שש שניות על בסיס רזולוציות מותאמות אישית במצב זיקוק מהיר.

איפה זה נופל

התוצאה מוגבלת באורך שלה ל־6 שניות בדיוק, ואי אפשר להאריך אותה כאן. חומרת A10G אחת מתקשה עם מודל של 13.6 מיליארד פרמטרים, ולכן מצב הזיקוק המהיר מופעל כברירת מחדל ומייצר סרטונים באיכות בסיסית בלבד. מודל הטקסט מבוסס UMT5 ולא מותאם להנחיות בעברית, כך שפרומפטים בעברית יתנו תוצאות משובשות. אין בממשק דוגמאות מובנות מוכנות מראש להרצה בלחיצה אחת, אז תצטרכו להביא חומרים משלכם.

שאלות
נפוצות

האם השימוש בממשק הזה עולה כסף?

לא, השימוש פתוח ואינו דורש תשלום. עם זאת, הוא מסתמך על חומרה משותפת מסוג Zero-A10G, מה שאומר שזמני ההמתנה והייצור תלויים בעומס הכללי.

כמה זמן לוקח לייצר סרטון של 6 שניות?

במצב Distill שמופעל כברירת מחדל הרינדור מהיר יחסית. אם תפעילו את מצב Refine או תעלו ל־720p, המודל מבצע שני שלבי עיבוד כבדים והרינדור ייקח זמן רב יותר.

האם אפשר להריץ את זה באופן מקומי במחשב שלי?

הקוד והמשקולות מבוססים על meituan-longcat/LongCat-Video וזמינים להורדה. כדי להריץ אותם מקומית תצטרכו כרטיס מסך חזק מאוד עם נפח זיכרון גבוה שמתאים למודל של 13.6 מיליארד פרמטרים.

במה הממשק הזה שונה מהרצה ישירה של המודל?

הממשק עוטף את המודל בסביבת Gradio פשוטה ומגביל אתכם לבחירות מוגדרות מראש של 6 שניות ומצבי עבודה ספציפיים. הוא חוסך כתיבת קוד והגדרת ספריות, אך מגביל את הגמישות המלאה של הצינור המקורי.

איך משתמשים

בוחרים לשונית, כותבים הנחיה, ולוחצים על כפתור הייצור של סרטון ה־6 שניות. אם שכחתם להקליד טקסט או להעלות תמונה בלשונית המתאימה, הממשק יקפיץ שגיאה ויסרב להמשיך.

העיבוד מתבצע על גבי תשתית Zero-A10G דרך חבילת spaces. החומרה הזו מקצה מאיץ גרפי רק בזמן הפעולה בפועל, כך שאם יש עומס של משתמשים ברשת תמתינו בתור, וזמן הרינדור יהיה איטי משמעותית אם תבחרו במצב Refine או ברזולוציה של 720p.

הרישיון

הרישיון של המרחב מוגדר כלא דווח. מצב כזה משאיר סימן שאלה לגבי שימוש מסחרי בסרטונים שנוצרים או זכויות על תמונות שאתם מעלים, ולא כדאי להסתמך עליו לפרויקטים מסחריים בלי לבדוק את תנאי השימוש המקוריים של חברת Meituan בעמוד המודל.

הרישיון המלא ב־Hugging Face ↗