GPT
S

shap-e-img2img

קוד פתוח

openaimit2023-07-04

  • diffusers
  • image-to-image
  • text-to-3d
  • shap-e

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

הכלי מייצר ייצוג תלת ממדי מתוך תמונה דו ממדית סינתטית בתוך שניות. פתרון מתאים למי שרוצה להפיק רשתות או שדות קרינה ישירות מתוך תמונה בודדת.

  • 5.6 GBמשקל הקבצים
  • 5,344הורדות בחודש
  • 59לייקים

מה זה

מדובר במודל דיפוזיה מבית OpenAI שלוקח תמונה דו ממדית סינתטית וממיר אותה לאובייקט תלת ממדי. בניגוד למודלים ישנים שמייצרים ייצוג בודד בלבד כמו ענני נקודות, הוא יוצר פרמטרים של פונקציות מרומזות. המשמעות היא שאפשר לחלץ מהתוצר גם מודל תלת ממדי מרושת וגם שדות קרינה נירוניים (NeRF).

האימון מתבצע בשני שלבים, קידוד נכסי תלת ממד לפונקציה מרומזת, ואימון מודל דיפוזיה מותנה על הפלטים האלה. ביחס לקודמו Point-E, החוקרים מדווחים שהוא מתכנס מהר יותר ומגיע לאיכות שווה או טובה יותר תוך שניות בודדות של דגימה.

מתאים ל

  • יצירת נכסי תלת ממד למשחקים

    מאפשר לייצר טיוטות מהירות של אובייקטים ומשטחים מתוך איורים סינתטיים בכמה שניות.

  • עיבוד NeRF מתמונות

    מפיק ישירות ייצוגים של שדות קרינה בלי לעבור בצינורות עיבוד ידניים ארוכים.

  • פרוטוטייפינג לעיצוב

    מספק הדמיה תלת ממדית ראשונית ומהירה מרעיונות גרפיים שנוצרו במחוללי תמונות.

איפה זה נופל

ההגדרה הרשמית של המודל מציינת שהוא מיועד לתמונות דו ממדיות סינתטיות. אם תזינו לו תמונות מורכבות מהעולם האמיתי, צילומים בתאורה קשה או זוויות לא שגרתיות, התוצאה עלולה להתעוות לחלוטין. מעבר לכך, הכרטיס אינו מפרט את ההטיות והמגבלות הנוספות באופן ישיר ומפנה לקריאה במאמר ובכרטיס המקורי.

שאלות
נפוצות

האם המודל מקבל כל תמונה רגילה שצילמתי בטלפון?

הכרטיס מדגיש שהמודל אומן על תמונות דו ממדיות סינתטיות. תמונות מהעולם האמיתי עם רקעים מורכבים עשויות להניב תוצאות פחות טובות או פגומות.

מה ההבדל בין המשקל הזה לגרסת הטקסט הרגילה של Shap-E?

הגרסה הזו דורשת תמונה קיימת כקלט ומייצרת לפיה את התלת ממד, בעוד הגרסה המקבילה openai/shap-e מייצרת אובייקט ישירות מתיאור טקסטואלי.

איך מריצים

המודל שוקל 5.6 גיגה בייט על פני 16 קבצים, והוא רץ ישירות בספריית diffusers של פייתון על כרטיס גרפי עם תמיכת CUDA. בקוד ההרצה הרשמי מגדירים גודל של 256, 64 צעדי הסקה, ומשתמשים במחלקת ShapEImg2ImgPipeline כדי לקבל את הפלט.

מבחינת משאבים, מומלץ כרטיס עם זיכרון ייעודי סביר כדי לייצר כמה זוויות במקביל. אם אין לכם גישה לכרטיס גרפי מקומי עם זיכרון מתאים, הרצה מקומית על מעבד תהיה אטית להחריד, ובמצב כזה עדיף לשקול שירות ענן או מכונה מרוחקת שמציעה סביבת חישוב גרפית.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("openai/shap-e-img2img")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא MIT, וזה נותן לכם חופש מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לכלול אותו במוצר קנייני ולהפיץ אותו הלאה, בלי לשלם תמלוגים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗