GPT
C

ChronoEdit-14B-Diffusers

קוד פתוח

nvidiaapache-2.02025-10-28

  • diffusers
  • safetensors
  • image editing
  • video generation
  • other

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל עריכת תמונות שמבין פיזיקה ופעולות בעולם האמיתי בזכות אימון על וידאו. אתם נותנים תמונה והוראה טקסטואלית, והוא מייצר תמונה ערוכה שנראית עקבית בזמן.

  • 16Bפרמטרים
  • 90.9 GBמשקל הקבצים
  • 115הורדות בחודש
  • 171לייקים

מה זה

במקום לערוך פיקסלים באופן שטחי, המודל הזה מבוסס על מודל וידאו גנרטיבי של 14 מיליארד פרמטרים. תהליך ההסקה מחולק לשניים, שלב של הסקת מסקנות וידאו כדי לחשב מסלול פיזיקלי סמוי, ושלב עריכה שגוזר ממנו את התוצאה הסופית. התהליך הזה משתמש בטוקנייזר של Cosmos כדי לקודד את התמונה למרחב סמוי ואז מפעיל עליה טרנספורמר דיפיוז'ן ייעודי.

ההבדל העיקרי מול מודלים רגילים לעריכת תמונות הוא המיקוד בסימולציה של עולם פיזיקלי. הוא אומן על מיליוני דוגמאות של אינטראקציה סינתטית, כמו זרועות רובוטיות שמרימות חפצים, ולכן הוא יודע לשמר זהות של אובייקטים ולייצר שינויים שמתיישבים עם חוקי התנועה ולא רק עם הדמיון הוויזואלי.

מתאים ל

  • סימולציה לרובוטיקה

    חיזוי תוצאה של פעולות פיזיות כמו דחיפה או הרמה של חפץ לפי תמונה והוראה.

  • עריכת תמונות מודעת פיזיקה

    שינוי מיקום עצמים בתמונה תוך שמירה על עקביות של משקל, תנועה וזהות.

  • בנצ'מרק למודלי עולם

    בדיקת יכולות תפיסה מרחבית והסקה בזמן של מערכות בינה מלאכותית פיזית.

איפה זה נופל

הכרטיס מציין במפורש שהאימון לפעולות פיזיקליות התבסס אך ורק על נתונים סינתטיים. אם תנסו להריץ אותו על תרחיש שלא הופיע במאגר הסינתטי שיוצר מראש, יכולת ההכללה שלו תיפגע בצורה חדה. הוא יועד לרובוטיקה ו־Physical AI, ולכן בדיקות על משימות עריכה כלליות יניבו תוצאות לא צפויות ומאכזבות. בנוסף, המודל לא תומך בעברית, הטקסט מוגבל לכ־300 טוקנים באנגלית או סינית, והוא אינו מטשטש או שומר על פרופורציות של פנים וקניין רוחני.

שאלות
נפוצות

האם אפשר לתת למודל הוראות עריכה בעברית?

לא. המודל אומן ותומך רשמית רק באנגלית ובסינית, עם הגבלה של עד כ־300 טוקנים לטקסט הקלט. פקודות בעברית יובילו לתוצאות פגומות או שגיאות עיבוד.

איזה כרטיס מסך מינימלי צריך כדי להפעיל אותו?

הקבצים שוקלים מעל 90 גיגה בייט, כך שצריך כרטיס שרת ייעודי כמו H100, B200 או מערך של כרטיסי A100 עם לפחות 80GB זיכרון. כרטיסים צרכניים פשוט לא יחזיקו את המשקלים בזיכרון.

האם המודל מתאים לעריכת תמונות יומיומיות של אנשים?

לא מומלץ. NVIDIA מצהירה שהוא אומן בעיקר על דאטה סינתטי למשימות פיזיקליות של רובוטים, ושהוא אינו משמר פרופורציות של אנשים בתמונות.

איך מריצים

המשקל הכולל של הקבצים עומד על כמעט 91 גיגה בייט בפורמט diffusers, כך שתשכחו מהרצה על מחשב אישי או כרטיס ביתי פשוט. כדי להריץ את הדבר הזה מקומית אתם צריכים חומרה ברמה של Hopper או Blackwell כמו H100 או B200, או לכל הפחות שרת עם כרטיסי Ampere או Lovelace מקצועיים ומערכת הפעלה לינוקס.

אפשר להריץ אותו דרך PyTorch עם ספריית Diffusers, ובסביבת ייצור עדיף לחבר אותו ל־Triton או TensorRT. אם אין לכם גישה לשרת GPU כבד עם לפחות שמונים גיגה זיכרון פנוי רק למשקלים, אין טעם לנסות להרים אותו לבד ועדיף להמתין לממשק ענן או להשתמש ב־API.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("nvidia/ChronoEdit-14B-Diffusers")
img = pipe("a photo").images[0]

הקבצים

144 קבצים במאגר, 90.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מוצהר כרישיון Apache 2.0 ומיועד גם לשימוש מסחרי, אך הוא כפוף במקביל להסכם הרישיון הפתוח של NVIDIA. התנאי המרכזי שחשוב לשים לב אליו הוא איסור מוחלט על עקיפה, ביטול או פגיעה במנגנוני אבטחה, הגבלות טכניות או חומות מגן שמגיעים איתו. אם תנטרלו מגבלת בטיחות, הרישיון שלכם מבוטל מיידית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗