GPT
S

shap-e

קוד פתוח

openaimit2023-07-04

  • diffusers
  • text-to-image
  • shap-e
  • text-to-3d

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

הופך טקסט ישירות למודל תלת ממדי תוך שניות בודדות. מתאים למי שרוצה לייצר אובייקטים פשוטים בלי להסתבך עם ענני נקודות כבדים.

  • 4.6 GBמשקל הקבצים
  • 7,562הורדות בחודש
  • 281לייקים

מה זה

הפיתוח הזה של OpenAI מייצר אובייקטים תלת ממדיים מתיאור טקסטואלי, אבל בניגוד לשיטות קודמות שפלטו רק ענן נקודות, הוא מייצר פרמטרים של פונקציות מרומזות. המשמעות היא שניתן לרנדר את התוצאה גם כרשת מצולעים עם טקסטורות וגם כשדות קרינה עצביים, מה שנותן גמישות רבה בייצוג התוצר הסופי.

האימון נעשה בשני שלבים, קידוד נכסי תלת ממד לפרמטרים מרומזים, ואז הפעלת מודל דיפוזיה מותנה על הפלט הזה. בהשוואה ל־Point-E, תהליך ההתכנסות כאן מהיר בהרבה ואיכות הדגימות שמתקבלת שווה או טובה יותר, למרות שמדובר במרחב פלט מורכב בעל ממדים גבוהים יותר שמייצר נכסים מגוונים ומורכבים בתוך שניות.

מתאים ל

  • ייצור מודלים מהיר

    יצירה זריזה של נכסים תלת ממדיים בסיסיים ישירות מתיאור טקסטואלי לצורך הדגמות.

  • חילוץ רשתות תלת ממד

    הפקה של פונקציות מרומזות שמאפשרות המרה ישירה לרשתות מצולעים עם טקסטורה.

  • מחקר בתלת ממד גנרטיבי

    בדיקת ביצועים של מודלי דיפוזיה שמייצרים ייצוגים מרובים מול פתרונות ישנים.

איפה זה נופל

כרטיס המודל אינו מפרט בעצמו את המגבלות וההטיות ומפנה למאמר המקורי. מהדוגמאות וההגדרות עולה כי הרזולוציה המוגדרת מראש עומדת על 256 בלבד, מה שמייצר נכסים גסים למדי ולא אובייקטים ברמת פירוט שמתאימה להפקות משחקים מקצועיות. אם אתם צריכים גיאומטריה מדויקת, תצטרכו לעשות הרבה עיבוד ידני אחר כך.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות ברינדור לתוך משחקים?

לא מומלץ בלי עיבוד נוסף. התוצרים מגיעים ברזולוציה בסיסית שמספיקה לסקיצות ראשוניות, אבל חסרה את הפירוט הנדרש לנכס סופי.

מה ההבדל בינו לבין shap-e-img2img?

הגרסה הזו מקבלת הנחיית טקסט בלבד ומייצרת ממנה את המודל. הגרסה השנייה דורשת תמונת קלט דו ממדית כדי לייצר את האובייקט התלת ממדי.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.6 גיגה בייט, כך שאפשר להוריד ולהריץ אותו מקומית דרך ספריית diffusers עם PyTorch ישירות על גבי כרטיס מסך פשוט יחסית עם תמיכת CUDA. הקוד דורש התקנה של תלויות בסיסיות כמו transformers ו־accelerate, ומאפשר לקבל פלט תוך עשרות בודדות של צעדי דיפוזיה.

מי שרוצה להזין תמונה במקום טקסט יצטרך לפנות לגרסה הנפרדת שנקראת shap-e-img2img. ההרצה המקומית הגיונית למי שמחפש שליטה מלאה בתהליך, אבל במערכות ייצור עם עומס משתנה תצטרכו להביא בחשבון את עלויות החומרה והתחזוקה מול שירותים מנוהלים.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("openai/shap-e")
img = pipe("a photo").images[0]

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר להשתמש בקוד ובמשקלים לצרכים פרטיים או מסחריים, לשנות אותם ולשלב אותם בכל מוצר שתבחרו, בתנאי היחיד שאתם שומרים את הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗