GPT
C

Cosmos3-Super-Text2Image

קוד פתוח

nvidiaother2026-05-28

  • cosmos
  • diffusers
  • safetensors
  • cosmos3_omni
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מנוע יצירת תמונות מטקסט במשקל 65 מיליארד פרמטרים שמתמקד ברובוטיקה ופיזיקה בעולם האמיתי. אנבידיה בנתה אותו לחברות שמדמות סביבות עבודה תעשייתיות ולא למי שמחפש פוסטרים יפים.

  • 65Bפרמטרים
  • 262,144טוקנים בהקשר
  • 123 GBמשקל הקבצים
  • 1,813הורדות בחודש

מה זה

מדובר במודל ענק שפותח במקור כמודל עולם לסביבות פיזיות כמו נהיגה אוטונומית, רובוטיקה תעשייתית ומחסנים חכמים. הארכיטקטורה מבוססת על שילוב ממירי שפה עם ממירי דיפוזיה, כאשר החלק שמייצר תמונות עושה זאת באמצעות תהליך הסרת רעש הדרגתי שמכוון להבנה של אינטראקציות בחלל תלת ממדי.

במקום להתאמן רק על צילומים כלליים מהאינטרנט, הוא נשען על 1.3 מיליארד דגימות שכוללות נתוני חיישנים, מסלולי תנועה של זרועות רובוטיות וצילומי רכב. התוצאה היא מודל שמבין סימטריה, תאורה תעשייתית וחוקי תנועה טוב יותר ממחוללי תמונות טיפוסיים באותו סדר גודל.

מתאים ל

  • סימולציה לזרועות רובוטיות

    יצירת תמונות מציאותיות של סביבות עבודה תעשייתיות לאימון מערכות ראייה של רובוטים.

  • אימון מערכות רכב אוטונומי

    הפקת מצבי קיצון בכביש ותנאי מזג אוויר מורכבים על בסיס נתוני נהיגה קיימים.

  • תכנון מרחבים לוגיסטיים

    הדמיית תרחישי תנועה של כלים אוטונומיים ומכשולים בתוך מחסנים חכמים.

איפה זה נופל

המודל תומך רשמית אך ורק בפורמט BF16, ואין תמיכה מובנית בשיטות כימות כמו FP8 או FP4 שחוסכות זיכרון. תמונות קלט ופלט מוגבלות לרזולוציות קבועות מראש ואינן תומכות בגווני אפור. בנוסף, קבלת איכות מרבית תלויה בשלב מקדים שבו שולחים את הפרומפט למודל שפה מסחרי כמו קלוד כדי להמיר אותו למבנה JSON ייעודי. זה מסבך את הארכיטקטורה ומוסיף עלות וזמני השהיה לכל פנייה.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם כרטיס RTX בודד?

לא. משקל הקבצים לבדו מגיע ל־123 גיגה בייט והוא נבדק בריצת BF16 בלבד. תזדקקו לשרת עם לפחות ארבעה כרטיסי H200 או שמונה כרטיסי H100 כדי לטעון אותו ולייצר תמונות בקצב סביר.

האם חייבים מודל חיצוני של אנתרופיק כדי לשלוח פרומפטים?

אפשר להזין טקסט ישירות, אבל תיעוד המודל מבהיר שבשביל איכות מרבית נדרש עיבוד מקדים שבונה מבנה JSON בעזרת מודל שפה. אם תוותרו על השלב הזה, התוצאות עלולות להיות פחות מדויקות.

איך מריצים

כדי להרים 123 גיגה בייט של משקלים ברמת דיוק BF16 צריך שרת ייעודי כבד. אנבידיה בדקה את הריצה הזו על שמונה כרטיסי H100, או על ארבעה כרטיסי H200 או GB200, עם חלוקת זיכרון במקביל דרך vLLM-Omni או SGLang. שימוש בשכבות אופלואוד על חומרה חלשה יותר אפשרי טכנית, אבל גורר פגיעה חמורה בזמני היצירה.

ההפעלה מחייבת לינוקס, תמיכה בארכיטקטורת אמפר ומעלה, ובדיקות ייעודיות לפורמט הפרומפטים. המפרסמים ממליצים לעבד את הפרומפט מראש למבנה JSON מפורט דרך מודל שפה חיצוני לפני שליחתו למחולל.

pip install -U huggingface_hub
hf download nvidia/Cosmos3-Super-Text2Image

הקבצים

84 קבצים במאגר, 123 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון OpenMDW1.1, וכרטיס המודל מציין במפורש שהוא מיועד הן לשימוש מסחרי והן לשימוש שאינו מסחרי. עם זאת, ברישיונות מסוג זה קיימות הגבלות שימוש ודרישות בטיחות ספציפיות שחובה לקרוא בנוסח המקורי לפני שילוב שלו במערכות ייצור.

הרישיון המלא בעמוד המודל ↗