GPT
O

objaverse-xl

קוד פתוח

allenaiodc-by2023-08-17

מאגר ענק של מעל 10 מיליון אובייקטים בתלת-ממד ממקורות שונים ברשת. הוא מיועד למי שרוצה לאמן מודלי בסיס לראייה ממוחשבת ויצירת תלת-ממד עם הכללה רחבה במיוחד.

  • 2,272הורדות בחודש
  • 214לייקים

מה זה

המאגר כולל מידע וקישורים ליותר מעשרה מיליון מודלים תלת-ממדיים שנאספו מכמה אתרים שונים ברשת. הקבצים מחולקים לפי מקורות האיסוף, ביניהם GitHub, Sketchfab, Smithsonian ו־Thingiverse. החלוקה הפנימית במאגר מתבצעת באמצעות קובצי parquet ייעודיים לכל פלטפורמה, כולל קובצי alignment שמיועדים ליישור הנתונים.

המבנה הזה משמש בסיס לאימון מודלים כמו Zero123-XL, כשהמטרה היא להביא מגוון עצום של סגנונות גיאומטריים ומרקמים. הכרטיס אינו מפרט תהליכי סינון אוטומטיים או ניקוי ידני שנעשו על הגיאומטריה עצמה, אך החלוקה הברורה לפי אתרי המקור מאפשרת להבין מאיפה כל אובייקט הגיע ולברור את החלקים הרלוונטיים לפרויקט שלכם.

מתאים ל

  • אימון מודלי תלת-ממד

    אימון מודלי בסיס ליצירת תלת-ממד מטקסט או תמונה אחת.

  • סינתזת נקודות מבט

    יצירת זוויות צפייה חדשות של עצמים, ציורים ודמויות.

  • הנחיית רשתות NeRF

    שילוב עם כלים כמו DreamFusion ליצירת מודלים נפחיים שלמים.

איפה זה נופל

הטקסטים והמטא-דאטה במאגר מוגדרים באנגלית בלבד, ואין בו שום התאמה או ייצוג לשפה העברית. מעבר לכך, מכיוון שהתוכן נאסף מאתרים פתוחים שונים, קיימת הטיה טבעית לעולמות התוכן של אותם אתרים, כמו הדפסות תלת-ממד של Thingiverse או סריקות של מוזיאון Smithsonian. הכרטיס לא מציין בדיקות איכות שנעשו למודלים, כך שחובה לסנן רשתות שבורות, גיאומטריה לא תקינה וזכויות יוצרים של קבצים בודדים לפני שימוש במוצר אמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הכללי של המאגר הוא ODC-By ומאפשר זאת תחת ייחוס, אך האובייקטים עצמם מגיעים ברישיונות נפרדים. בנוסף, רכיבים מסוימים כמו הנתונים של Polycam מוגבלים רשמית למחקר אקדמי בלבד.

האם יש במאגר תמיכה בעברית?

המאגר מוגדר רשמית בשפה האנגלית בלבד. שמות המודלים והתיאורים המגיעים מאתרי המקור אינם כוללים התייחסות לעברית.

מה ההבדל בין המאגר הזה לגרסה הראשונה של Objaverse?

הגרסה הראשונה כללה כ־800 אלף אובייקטים בלבד. הגרסה הנוכחית גדולה יותר בסדר גודל ומכילה מעל עשרה מיליון מודלים ממקורות רחבים בהרבה.

איך טוענים

הנתונים מחולקים לתשעה קבצים, בעיקר קובצי parquet לפי מקורות המידע. הגישה למאגר עצמו פתוחה, אבל חלק מהמידע שנאסף מפלטפורמת Polycam אינו כלול ישירות ודורש מילוי טופס בקשה ואישור נפרד למטרות מחקר אקדמי בלבד. כדי להוריד את המודלים בפועל צריך להשתמש בסקריפטים או במחברת Colab ייעודית שהמפתחים שיתפו.

from datasets import load_dataset

ds = load_dataset("allenai/objaverse-xl")

הרישיון

המאגר בכללותו מופץ תחת רישיון ODC-By שמחייב מתן קרדיט מתאים. יחד עם זאת, הכרטיס מדגיש מפורשות שכל אובייקט בודד בתוך המאגר מחזיק ברישיון מקורי משלו. המשמעות היא שאי אפשר להניח שמותר להשתמש בכל התוכן באופן מסחרי, ובפרט חלקים כמו הנתונים מ־Polycam מוגבלים מראש לשימוש מחקרי בלבד.

הרישיון המלא ב־Hugging Face ↗