GPT
C

Cosmos3-Nano

קוד פתוח

nvidiaother2026-03-10

  • cosmos
  • diffusers
  • safetensors
  • cosmos3_omni
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל עולם שמחבר וידאו, שמע, טקסט ופקודות תנועה לרובוטים בתוך ארכיטקטורה אחת. הוא מיועד למי שבונה סימולציות פיזיות או מערכות בקרה ולא מחפש רק צ'אטבוט רגיל.

  • 16Bפרמטרים
  • 262,144טוקנים בהקשר
  • 32.6 GBמשקל הקבצים
  • 236,414הורדות בחודש

מה זה

במקום להפריד בין מודל שפה, מודל תמונה ומודל בקרה נפרד לרובוטיקה, המערכת הזו מחברת בין שני רכיבי טרנספורמר. מודל אחד מייצר טקסט בצורה רציפה של ניחוש הטוקן הבא, והשני משתמש בדיפוזיה כדי לייצר וידאו, תמונות, שמע ופקודות פעולה פיזיות. השילוב מאפשר לו לנתח סביבה בתלת־ממד ובו זמנית להוציא סרטון עם סאונד או מסלול מוטורי מתאים.

הוא מקבל טקסט, תמונות, וידאו ונתוני חיישנים, ויודע לתפקד גם כמנוע הסקת מסקנות עם חלון גדול מאוד של טוקנים וגם כמחולל. אם משווים אותו למודלים אחרים באותו סדר גודל, הייחוד שלו הוא בחיבור הישיר בין הבנה של פיזיקה לבין פלט של קואורדינטות ותנועות רובוטיות אמיתיות, ולא רק יצירת מדיה יפה לעין.

מתאים ל

  • סימולציה לרכב אוטונומי

    חיזוי המשך נסיעה בווידאו וניתוח מסלולי תנועה מוגדרים של תשעה ממדים על בסיס צילומי דרך.

  • בקרת זרועות רובוטיות

    תרגום הוראות שפה ותמונות לפקודות תנועה ומיקום תלת־ממדי עבור זרועות תעשייתיות תואמות.

  • יצירת סרטוני הדמיה עם קול

    יצירת קטעי וידאו קצרים ברזולוציית 720p הכוללים פס קול סטריאופוני תואם ישירות מתוך תמונה או טקסט.

איפה זה נופל

המודל מוגבל מאוד במה שהוא מקבל ומייצר. קלט הווידאו מוגבל לחמישה פריימים בלבד, וקלט השמע מוגבל לחצי שנייה. רזולוציית התמונה והווידאו מגיעה עד 720p בלבד, ואין תמיכה בתמונות שחור־לבן אלא רק ב־sRGB.

בנוסף, פקודות הפעולה הרובוטיות נתמכות אך ורק ברשימה סגורה של פלטפורמות כמו זרועות Franka Panda, רכבים אוטונומיים או תנועת מצלמה מוגדרת. מי שבונה חומרה מותאמת אישית לא יוכל להשתמש ביכולות התנועה שלו בלי התאמות מורכבות, וזמני האתחול של השרת עשויים להיות ארוכים מאוד.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי?

לא באופן מעשי. הקבצים תופסים 32.6 גיגהבייט ורצים בפורמט BF16, כך שכרטיס ביתי פשוט ייחנק מחוסר זיכרון. צריך כרטיס ארגוני חזק או מערך שרתים ייעודי של אנבידיה.

האם המודל יודע לייצר סרטונים ארוכים?

הוא מייצר מקטעים של עד 400 פריימים, כשברירת המחדל עומדת על 189 פריימים בלבד. זה מספיק לקליפים קצרים של שניות בודדות ולא לסרטים שלמים.

איך מריצים

כדי להריץ אותו צריך שרת לינוקס עם כרטיסי אנבידיה מדורות Ampere, Hopper או Blackwell. הקבצים שוקלים מעל 32 גיגהבייט והדיוק שנבדק הוא רק BF16, ללא תמיכה רשמית בקוונטיזציה של שמונה או ארבעה ביט, כך שכרטיס כמו H200 הוא ברירת המחדל הטבעית שלו. הוא נתמך במנועים כמו vLLM-Omni, SGLang, Hugging Face Diffusers ופייטורץ'.

לפני שמייצרים וידאו מטקסט, החברה ממליצה להרחיב את הפרומפט למבנה JSON מפורט דרך מודל שפה חיצוני כמו קלוד. אם אין לכם גישה למערך כרטיסי מסך ארגוניים חזקים, אין טעם לנסות להריץ אותו מקומית על מחשב פיתוח רגיל.

pip install -U huggingface_hub
hf download nvidia/Cosmos3-Nano

הקבצים

68 קבצים במאגר, 32.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון OpenMDW1.1 ופתוח לשימוש מסחרי ולא מסחרי. עם זאת, מדובר ברישיון ייעודי למודלי עולם ולא ברישיון קוד פתוח סטנדרטי כמו MIT או אפאצ'י, ולכן חברות מסחריות חייבות לקרוא היטב את תנאי המסמך לפני הטמעה במוצר סופי.

הרישיון המלא בעמוד המודל ↗