GPT
C

Cap3D

קוד פתוח

tiangeodc-by2023-05-28

מאגר ענק של תיאורי טקסט, ענני נקודות ותמונות מרונדרות עבור מודלים תלת ממדיים. הוא מיועד למי שמאמן מודלים של יצירת תלת ממד מטקסט או תמונה וצריך דאטה סינתטי מתויג בהיקף נרחב.

  • 7,890הורדות בחודש
  • 127לייקים

מה זה

המאגר מחזיק מעל מיליון ושש מאות אלף זוגות של תיאורי טקסט ואובייקטים בתלת ממד. הנתונים נשענים על מקורות קיימים ומוכרים, בעיקר Objaverse וגרסת XL שלו, לצד דגימות מתוך ABO ו־ShapeNet. התיאורים עצמם נוצרו בצורה אוטומטית באמצעות המודלים Cap3D ו־DiffuRank, ולא נכתבו ידנית על ידי בני אדם, למעט קובץ קטן של דוגמאות אנושיות שנמצא בתיקיית העזר.

המבנה הפנימי מחולק לפי סוגי המידע והמקורות. תיאורי הטקסט שמורים בקובצי CSV עם מזהי האובייקטים המקוריים, ענני הנקודות מגיעים כקובצי פייתורץ pt או בפורמט ply עם שש עשרה אלף נקודות צבעוניות לאובייקט, וחבילות הרינדור כוללות עשרים זוויות צילום שונות לכל פריט יחד עם עומק, מסכות ופרמטרים של המצלמה.

מתאים ל

  • אימון מודלי text-to-3d

    חיבור תיאורי טקסט מפורטים לענני נקודות כדי ללמד מודל לייצר מבנה תלת ממדי מהנחיה כתובה.

  • יצירת תלת ממד מתמונה

    שימוש בעשרים זוויות הרינדור השונות ובנתוני המצלמה והעומק כדי לאמן רשתות שמשחזרות נפח מתמונה בודדת.

  • אימון מקודדי ייצוג מרחבי

    הזנת ענני הנקודות המנורמלים כטנזורים מוכנים ישירות למודלי פייתורץ שמנתחים גאומטריה וצבע.

איפה זה נופל

הבעיה המרכזית היא שהתיאורים נוצרו על ידי מכונות שצפו בהיטלים דו ממדיים, ולכן תיתכן הזיה של פרטים, פספוס של גאומטריה מורכבת או חוסר הבנה של המבנה המרחבי האמיתי. כל הטקסטים הם באנגלית בלבד. בנוסף, האיכות של המודלים עצמם אינה אחידה כי המקורות מכילים סריקות גולמיות ונכסים ברמות גימור שונות, כך שאי אפשר להזין את הנתונים לאימון מודל פרודקשן בלי סינון מקדים של רעשים ותיאורים שגויים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הרישיון של החוקרים הוא odc-by ודורש ייחוס בלבד, אך האובייקטים עצמם נאספו ממאגרים חיצוניים כמו Objaverse שבהם חלק מהמודלים מוגבלים לשימוש לא מסחרי. אם המטרה היא מסחרית, אתם חייבים להצליב את המזהים עם קובצי הרישיונות המקוריים ולסנן פריטים מוגנים.

כמה שטח אחסון צריך בשביל לעבוד איתו?

אם מורידים רק את קובצי ה־CSV עם התיאורים מדובר במגה בייטים בודדים שנטענים בקלות. לעומת זאת, הורדה מלאה של ענני הנקודות ועשרים הרינדורים לכל אחד ממיליון וחצי האובייקטים דורשת טרה בייטים רבים של אחסון מהיר.

האם יש בדאטהסט תמיכה בעברית?

אין בדאטהסט שום תוכן בעברית, וכל מיליוני התיאורים נוצרו באנגלית בלבד. אם אתם צריכים לאמן מודל שיבין עברית, תצטרכו לתרגם את קובצי ה־CSV בתהליך נפרד.

איך נוצרו התיאורים של האובייקטים?

החוקרים רינדרו תמונות של כל מודל מכמה זוויות והשתמשו במודלי ראייה ושפה כדי לייצר תיאור מילולי לכל זווית. לאחר מכן הם סינתזו ודירגו את התיאורים לכדי פסקה אחת באמצעות אלגוריתמים ייעודיים שפותחו במחקר שלהם.

איך טוענים

אין צורך באישור גישה כדי להוריד את הקבצים, אבל מדובר ביותר משלוש מאות קבצים דחוסים בנפח עצום. אם אתם צריכים רק את הטקסט כדי למפות אותו לקבצי תלת ממד שכבר יש לכם, טוענים ישירות את קובצי ה־CSV הרלוונטיים באמצעות pandas. אם אתם מתכננים לעבוד עם הגאומטריה או התמונות, תצטרכו להוריד ארכיוני zip כבדים, לחלץ אותם מקומית לפי מזהה האובייקט, ולעבד טנזורים של PyTorch במידות של 16384 על 6 עבור ענני הנקודות.

from datasets import load_dataset

ds = load_dataset("tiange/Cap3D")

הרישיון

התיאורים והעיבודים שנוצרו בפרויקט משוחררים ברישיון odc-by שמחייב מתן קרדיט בלבד. עם זאת, האובייקטים התלת ממדיים המקוריים שייכים ליוצרים מ־Objaverse ומאגרים אחרים, וחלקם כפופים לרישיונות שאוסרים שימוש מסחרי. מודל שתאמנו עלול להיתקל בבעיה משפטית אם תשתמשו בו מסחרית בלי לסנן החוצה את האובייקטים המוגבלים.

הרישיון המלא ב־Hugging Face ↗