GPT
C

Cosmos3-Super-Image2Video

קוד פתוח

nvidiaother2026-05-21

  • cosmos
  • diffusers
  • safetensors
  • cosmos3_omni
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המודל מייצר סרטוני וידאו קצרים מתמונה יחידה והוראת טקסט. הוא פונה למי שמפתח יישומי רובוטיקה או עולם פיזיקלי ורוצה סימולציה ויזואלית עקבית בהיקף של 65 מיליארד פרמטרים.

  • 65Bפרמטרים
  • 262,144טוקנים בהקשר
  • 122 GBמשקל הקבצים
  • 64,456הורדות בחודש

מה זה

מדובר במודל עולם פיזיקלי ממשפחת Cosmos 3 שממיר תמונה יחידה והוראות טקסט לסרטון MP4. הארכיטקטורה שלו נשענת על Mixture-of-Transformers שמשלבת מגדל אוטורגרסיבי לטקסט ומגדל דיפיוז'ן לרכיבים הרציפים של התמונה והווידאו. ברירת המחדל שלו מפיקה קטעים באורך 189 פריימים, כשהטווח הנתמך נע בין 5 ל־400 פריימים ברזולוציות של עד 720p וביחסי תצוגה מוגדרים מראש.

ההבדל המשמעותי בינו לבין מודלי וידאו כלליים בגודל 64B נובע מתחום ההתמחות. האימון שלו כלל מעל מיליארד דוגמאות שרובן וידאו ותמונות מעולמות הרכב האוטונומי, מצלמות גוף ורובוטיקה, לצד שילוב של טרייקטוריות פעולה ומבני נתונים של זרועות מכניות. לכן הוא נועד לשמור על עקביות פיזיקלית ומבנית טובה יותר במרחב ולא רק לייצר אנימציה אסתטית.

מתאים ל

  • סימולציה לרובוטיקה ואוטונומיה

    הוא מייצר רצפי תנועה עקביים פיזיקלית מתמונת מצב בודדת, על בסיס אימון נרחב בתנועות זרועות ומצלמות רכב.

  • הנפשת תמונות סטילס לפי תרחיש

    הוא הופך תמונה קבועה לסרטון באורך של עד 400 פריימים עם שליטה בזוויות צילום ובתנועה במרחב.

  • העשרת דאטה לאימון ראייה ממוחשבת

    הוא מייצר סרטוני המשך ממצבי קיצון ויזואליים במפעלים או חללים חכמים כשחסר וידאו אמיתי מתועד.

איפה זה נופל

האיכות שלו תלויה לחלוטין בתהליך מקדים ומסורבל. הוא דורש הפיכה של הטקסט הרגיל למבנה JSON ייעודי באמצעות מודל שפה ויזואלי חיצוני לפני הריצה, כך שאי אפשר פשוט לזרוק לו פרומפט פשוט ולצפות לתוצאה טובה. מעבר לזה, הוא מוגבל לדיוק BF16 בלבד בלי תמיכה רשמית ב־FP8 או FP4, תומך רק בקלט צבעוני sRGB ולא מקבל תמונות שחור־לבן, והרזולוציה המקסימלית נעצרת ב־720p.

שאלות
נפוצות

האם אפשר לשלוח לו פרומפט טקסטואלי רגיל ישירות?

הוא עובד בצורה מיטבית רק עם פרומפטים שעברו המרה למבנה JSON ייעודי. בכרטיס המודל היצרן מציין שיש להשתמש במודל שפה חיצוני כדי לעבד את הטקסט ותמונת המקור לפני שמעבירים אותם למנוע הווידאו.

האם אפשר להריץ אותו על מחשב מקומי עם כרטיס מסך בודד?

לא, המשקולות שוקלות 122GB והוא דורש מערך של לפחות 2 עד 8 כרטיסי H100, H200 או A100. כרטיס בודד טיפוסי לא יחזיק את המודל בזיכרון, בטח שלא בדיוק BF16 הנדרש.

איך מריצים

בשביל להריץ אותו מקומית צריך מערך חומרה רציני מאוד. החבילה שוקלת 122GB ב־69 קבצים, והוא נבדק רשמית רק בדיוק BF16 על ארכיטקטורות Ampere, Hopper או Blackwell בסביבת לינוקס. התצורה המומלצת ב־vLLM-Omni כוללת שרת של 8 כרטיסי H100, H200 או A100 כדי לקבל סרטון ב־55 שניות, כשעל שני כרטיסי H200 אותו תהליך לוקח כשלוש דקות. אפשר להריץ אותו גם דרך SGLang עם 4 מעבדים גרפיים ומודול Cosmos Guardrail.

אם אין לכם קלאסטר שרתים ייעודי עם מאות גיגה־בייט של זיכרון גרפי זמין, אין טעם לנסות להרים אותו על תחנת עבודה בודדת. במצב כזה עדיף לצרוך אותו דרך נקודת קצה מרוחקת עם תאימות ל־OpenAI במקום לשלם על תשתיות יקרות ותחזוקת תלויות מורכבת.

pip install -U huggingface_hub
hf download nvidia/Cosmos3-Super-Image2Video

הקבצים

69 קבצים במאגר, 122 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון OpenMDW1.1, שעל פי כרטיס המודל מאושר לשימוש מסחרי וגם לשימוש שאינו מסחרי ברחבי העולם. עדיין יש לוודא שהתנאים הספציפיים של רישיון זה מתאימים לאופן שבו אתם משלבים את המשקולות במוצר שלכם.

הרישיון המלא בעמוד המודל ↗