GPT
O

objaverse

קוד פתוח

allenaiodc-by2022-12-12

מאגר עצום של מעל 800 אלף אובייקטים תלת ממדיים עם תיוגים באנגלית. הוא מיועד למי שצריך לאמן או לבחון מודלים גנרטיביים ומודלים של ראייה ממוחשבת בתלת ממד.

  • 606,315הורדות בחודש
  • 457לייקים

מה זה

המאגר מכיל מעל 800 אלף מודלים תלת ממדיים שנאספו עם תיוגים נלווים, כשהקבצים עצמם מאורגנים ומאוחסנים בפורמט glb בתוך תיקיות ייעודיות. מעבר להכרזה הכללית על היקף האובייקטים ועל שפת הנתונים שהיא אנגלית, הכרטיס הנוכחי לא מפרט מאיפה בדיוק נמשכו המודלים או אילו שלבי סינון וניקוי בוצעו לפני האריזה שלהם.

מבחינת חלוקה פנימית, הדגש העיקרי בכרטיס הוא סביב הרכב הרישיונות של הפריטים הבודדים. יש כאן תערובת של חבילות תחת רישיונות שונים: הרוב המוחלט תחת CC-BY עם 721 אלף פריטים, לצד 52 אלף תחת CC-BY-NC-SA, כ־25 אלף תחת CC-BY-NC, כ־16 אלף תחת CC-BY-SA, ועוד 3.5 אלף פריטים ברישיון CC0. המטא-דאטה מספק את הרישיון הספציפי לכל פריט.

מתאים ל

  • אימון מודלי גנרציה בתלת ממד

    שימוש בקובצי ה־glb לאימון מודלים של יצירת צורות תלת ממדיות מטקסט או מתמונות.

  • מחקר גיאומטרי והערכה

    בחינת ביצועים של אלגוריתמים לראייה ממוחשבת על גבי מגוון של מאות אלפי עצמים.

  • בניית מאגרי מידע מסחריים

    סינון קפדני של פריטי CC-BY ו־CC0 לצורך שילוב מודלים במוצרים פעילים.

איפה זה נופל

הכרטיס לא מציג ניתוח של הטיות, חוסרים גיאומטריים או מידע על גיל הנתונים, מה שאומר שאתם מקבלים את הקבצים כפי שהם בלי עדות לסינון איכות. בנוסף, השפה המוגדרת היא אנגלית בלבד ולכן אין כאן תיוגים בעברית. אם אתם בונים מערכת מסחרית, יש פה מוקש של עשרות אלפי מודלים ברישיונות לא-מסחריים ושיתוף-זהה שחייבים לפלטר החוצה באופן ידני כדי למנוע זיהום משפטי.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצרים מסחריים?

המאגר כולו מוגדר תחת ODC-By, אך הוא מכיל עשרות אלפי אובייקטים עם תנאי NC שאוסרים שימוש מסחרי ותנאי SA שמחייבים רישוי זהה. שימוש מסחרי מחייב קריאה של המטא-דאטה וסינון של אותם קבצים, והסתמכות אך ורק על פריטי ה־CC0 וה־CC-BY.

האם המאגר כולל תיוגים בעברית?

השפה היחידה שמוגדרת עבור התיוגים והטקסטים במאגר היא אנגלית. אין תמיכה מובנית בעברית או תיוגים מקומיים, ולכן אם השפה קריטית לכם תצטרכו לתרגם את התיאורים באופן עצמאי.

איך נאספו האובייקטים והאם האיכות שלהם אחידה?

הכרטיס הנוכחי לא מפרט את מקורות האיסוף, שיטות הניקוי או בדיקות האיכות שנעשו על הקבצים. הפרטים המלאים הופנו למאמר האקדמי ולאתר הפרויקט, ולכן חשוב לבדוק את תקינות המאשים והטקסטורות בפועל לפני שמריצים אימון רחב.

באיזה פורמט הקבצים מגיעים?

האובייקטים התלת ממדיים מאוחסנים בפורמט glb ומחולקים על פני עשרות אלפי תיקיות פנימיות. לצד קובצי המודלים ישנו מטא-דאטה שמגדיר את פרטי הזיהוי והרישיון עבור כל עצם.

איך טוענים

הורדת החומרים נעשית ישירות מהמאגר, שכולל עשרות אלפי קובצי glb המחולקים לתתי-ספריות, ללא צורך בהרשאת גישה מיוחדת או אישור מראש. קחו בחשבון שמדובר במאות אלפי קבצים שמחייבים נפח אחסון משמעותי ותהליך משיכה מסודר, ושחובה לקרוא את קובץ המטא-דאטה של כל אובייקט כדי לבדוק תחת איזה רישיון הוא שוחרר לפני שמשלבים אותו בצינור הנתונים.

from datasets import load_dataset

ds = load_dataset("allenai/objaverse")

הרישיון

המאגר כחבילה מופץ תחת רישיון ODC-By, שדורש מתן קרדיט בלבד. עם זאת, כל אובייקט בודד מחזיק ברישיון משלו. יש פריטים תחת CC0 ו־CC-BY שמאפשרים שימוש מסחרי עם ייחוס מתאים, אך ישנם גם עשרות אלפי פריטים תחת רישיונות מגבילים של שימוש לא-מסחרי (NC) ושיתוף זהה (SA). אימון מודל על כלל המאגר בלי לפלטר את הרישיונות המגבילים עלול לחשוף את התוצר לבעיות ברישוי מסחרי.

הרישיון המלא ב־Hugging Face ↗