GPT
L

Lyra-2.0

קוד פתוח

nvidiaרישיון לא דווח2026-04-06

  • lyra-2.0
  • world
  • image-to-3d

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הופך תמונה בודדת לעולם תלת ממדי שניתן לנווט בו ברינדור מהיר. מתאים למי שחוקר ייצור סביבות ומחפש ייצוג מפורש של 3D Gaussians במקום סתם רצף וידאו.

  • 91.6 GBמשקל הקבצים
  • 425הורדות בחודש
  • 346לייקים

מה זה

בבסיס שלו יושב מודל וידאו של 14 מיליארד פרמטרים שנשען על WAN-14B, שמקבל תמונה בודדת ומערך תנועות מצלמה, ומייצר וידאו ארוך עם עקביות גיאומטרית. בשלב השני הוא משחזר את הרצף לסצנה מפורשת של 3D Gaussians בפורמט ענן נקודות, כך שאפשר לרנדר אותה בזמן אמת ולא רק לצפות בסרטון דו ממדי.

כדי למנוע מהמודל לשכוח אזורים במרחב או להיסחף בצורה מעוותת לאורך זמן, הוא שומר גיאומטריה לכל פריים כדי לקשר בין נקודות מבט קודמות ליעד, ומשתמש באימון שחושף אותו לשגיאות של עצמו כדי ללמוד לתקן אותן.

מתאים ל

  • מחקר מודלי עולם תלת ממד

    פיתוח אלגוריתמים לחקירת סביבות וירטואליות מבוססות 3D Gaussians מתמונה בודדת.

  • בדיקת עקביות גיאומטרית

    השוואת מנגנוני תיקון סחף בזמן ובמרחב מול מודלי וידאו מבוססי טרנספורמר.

  • ניסויי ייצור תנועת מצלמה

    סינתזה של זוויות צפייה חדשות לאורך 81 פריימים עבור הדמיות פנימיות.

איפה זה נופל

האימון התבסס במידה רבה על נתונים סינתטיים. בכרטיס המודל מציינים במפורש שאם תתנו לו סצנה בעולם האמיתי שחורגת ממאגר האימון הסינתטי, השחזור עלול להישבר ולהיות לא מדויק. בנוסף, לא ננקטו שום פעולות להפחתת הטיות, והוא מוגבל לפורמט קלט קשיח של רזולוציה וזוויות מצלמה מסוימות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בתוך משחק או מוצר מסחרי?

לא. הרישיון של אנבידיה אוסר במפורש שימוש בסביבת ייצור, הפצה או הפקת רווח מתוצרים. המודל מיועד אך ורק למחקר מדעי פנימי.

מה בדיוק מקבלים כפלט בסוף הריצה?

הפלט אינו סרטון רגיל אלא קובץ ענן נקודות, לרוב בסיומת ply, שמכיל 3D Gaussians. לכל אלמנט יש מיקום, צורה תלת ממדית, שקיפות וצבע שמאפשרים רינדור בזמן אמת.

האם אפשר להריץ אותו על מחשב אישי מקומי?

לא באופן מעשי. הקבצים שוקלים מעל 91 גיגה בייט ומבוססים על רשת של 14B פרמטרים, מה שמחייב חומרת שרתים מתקדמת מבוססת לינוקס עם נפח VRAM משמעותי.

איך מריצים

המשקל עומד על 91.6 גיגה בייט בתוך 89 קבצים, והוא דורש מאיצים של אנבידיה בארכיטקטורות Ampere, Hopper או Blackwell תחת לינוקס, עם מנוע ההרצה של WAN-2.1. אימון המודל דרש 32 שרתי H100, כך שהסקה של מודל כזה עם 14B פרמטרים דורשת שרת ייעודי כבד עם נפח זיכרון גרפי גדול מאוד, ללא אפשרות מעשית לרוץ על כרטיס שולחני בסיסי.

הוא מצפה לתמונת קלט ברזולוציה מדויקת של 480 על 832 ומערך מומלץ של 81 פריימים לנתוני המצלמה. אין כאן גרסאות שונות לבחירה, ואין שירות ענן ציבורי או API מנוהל מוכן, כך שאם אתם רוצים לבדוק אותו תצטרכו להקים את כל התשתית עצמאית בשרת.

pip install -U huggingface_hub
hf download nvidia/Lyra-2.0

הקבצים

89 קבצים במאגר, 91.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון מחקר ופיתוח מדעי פנימי של אנבידיה. אסור להפיץ אותו, אסור להציג אותו בפומבי, ואסור לחלוטין להשתמש בו בסביבת ייצור, למכור שירותים שנובעים ממנו או לייצר ממנו תוצרים מסחריים. בקיצור, מחקר בלבד במעבדה סגורה.

הרישיון המלא בעמוד המודל ↗