GPT
L

LongCat-Video

קוד פתוח

meituan-longcatmit2025-10-24

  • diffusers
  • safetensors
  • transformers
  • image-to-video
  • video-continuation

מודל פתוח שמייצר וממשיך וידאו של דקות ברזולוציית 720p. אם אתם צריכים שליטה מקומית מלאה ברצף וידאו ארוך בלי תלות בענן, שווה לבדוק אותו.

  • 77.6 GBמשקל הקבצים
  • 1,526הורדות בחודש
  • 562לייקים

מה זה

מדובר במודל צפוף של 13.6 מיליארד פרמטרים שפותח כדי לאחד יצירת וידאו מטקסט, מתמונה, והמשך של סרטון קיים תחת ארכיטקטורה אחת. הוא מאומן מראש על משימות של המשכיות וידאו כדי למנוע דעיכת איכות או עיוותי צבע כשהסרטון מתארך לכמה דקות, ומייצר פלטים בקצב של 30 פריימים לשנייה ברזולוציית 720p באמצעות גישת coarse-to-fine ותשומת לב דלילה.

במבחני MOS שהמפתחים הציגו, המודל עומד יפה מול מודלים קנייניים ומודלי קוד פתוח כמו Wan 2.2. ביצירת וידאו מטקסט הוא קיבל ציון איכות כולל של 3.38, מעט מעל Wan ומתחת ל־Veo3. ביצירת וידאו מתמונה הוא הגיע לציון כולל של 3.17, נמוך יותר ממתחריו, כשאיכות התנועה שלו בבדיקה הזו קיבלה 3.59 לעומת כ־3.8 אצל האחרים.

מתאים ל

  • הארכת סרטונים קיימים

    המודל אומן מראש על המשכיות וידאו ושומר על צבעים יציבים לאורך זמן.

  • הפקת וידאו מטקסט באופליין

    מאפשר לייצר סרטוני 720p מקומית ללא תלות בספק ענן חיצוני.

  • יצירת תוכן מבוסס תמונות

    מייצר הנפשה מקומית מתוך תמונת בסיס וטקסט תחת מודל יחיד.

איפה זה נופל

הנתונים מראים שהמודל חלש יחסית במשימות של תמונה לווידאו, במיוחד באיכות התנועה שקיבלה 3.59 ובהתאמה לתמונה המקורית שקיבלה 4.04 מול מעל 4.1 אצל המתחרים. הוא אומן ותומך רק באנגלית ובסינית, כך שפרומפטים בעברית לא יעבדו כאן באופן ישיר.

בנוסף, הכרטיס מציין במפורש שהמודל לא נבדק לכל תרחיש אפשרי ודורש הערכת בטיחות ודיוק לפני הטמעה. תצטרכו לבדוק בעצמכם מריחות ועיוותים פיזיקליים, במיוחד בהפקת סרטונים ארוכים.

שאלות
נפוצות

האם המודל מבין הוראות בעברית?

לא. המודל תומך רשמית באנגלית ובסינית בלבד. אם תזינו הנחיות בעברית, המודל לא יבין את הבקשה או יפיק תוצאות מעוותות, ולכן חובה לתרגם את הפרומפט לאנגלית לפני ההרצה.

האם ניתן להריץ את המודל על כרטיס מסך ביתי רגיל?

במשקל כולל של כ־78 ג'יגה-בייט ו־13.6 מיליארד פרמטרים צפופים, כרטיס ביתי פשוט לא יחזיק את המודל בזיכרון. תצטרכו כרטיס מקצועי עם VRAM גבוה במיוחד או שימוש בשני מאיצים במקביל כפי שמוצג בהוראות ההרצה.

האם יש גרסאות מוקטנות או מכווצות של המודל?

במאגר מופיע כרגע רק קובץ המשקלים המלא של 13.6B ללא גרסאות קוונטיזציה מובנות. עם זאת, קיימת תמיכה בכלי חיצוני בשם CacheDiT שמאיץ את ההסקה פי 1.7 בלי פגיעה מורגשת באיכות.

איך מריצים

כדי להתחיל מורידים 77.6 ג'יגה-בייט של משקלים ומריצים סקריפטים מבוססי PyTorch עם FlashAttention-2, FlashAttention-3 או xformers. קיימת גם תמיכה בהאצה חיצונית עם CacheDiT שמדווחת על שיפור מהירות של פי 1.7. יש ממשק הדגמה ב־Streamlit, אבל כדי לייצר וידאו באורך מלא תצטרכו להשתמש ב־torchrun.

מבחינת חומרה, מודל צפוף בגודל כזה ידרוש מאיץ גרפי חזק מאוד עם נפח זיכרון גבוה, או חלוקה לכמה מאיצים באמצעות context parallel כפי שהקוד מדגים. אם אין לכם שרת ייעודי עם מאיצים מתאימים, הרצה מקומית תהיה איטית ויקרה מדי ביחס לצריכת מודל דרך שירות חיצוני.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("meituan-longcat/LongCat-Video")
img = pipe("a photo").images[0]

הרישיון

המשקלים והקוד משוחררים תחת רישיון MIT. המשמעות היא חופש מלא להריץ, לשנות ולשלב את המודל במוצרים מסחריים בלי תשלום תמלוגים, כל עוד שומרים על תנאי הרישיון המקורי. הרישיון לא מעניק זכויות בסימני מסחר או פטנטים של Meituan.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗