GPT
M

MatSynth

קוד פתוח

gvecchioרישיון לא דווח2023-11-29

  • materials
  • pbr
  • 4d
  • graphics
  • rendering

מעל 4,000 חומרי PBR ברזולוציית 4K עם מפות טקסטורה מלאות. המאגר מיועד לאימון מודלים של יצירת חומרים, גרפיקה ממוחשבת והדמיות תלת-ממד.

  • 12,676הורדות בחודש
  • 61לייקים

מה זה

המאגר מכיל 4,069 חומרי PBR ייחודיים שחולקו לשני חלקים, אימון עם 3,980 חומרים ומבחן עם 89 חומרים. כל רשומה כוללת סט מפות מובנה שמכיל Basecolor, Diffuse, Normal בתקן OpenGL, מפת Height ברמת 16-ביט, Roughness, Metallic, Specular, ולעיתים Opacity. לצד המפות נכללים רינדורים בתנאי תאורה משתנים וחיתוכים בסדרי גודל שונים.

היוצרים אספו במקור מעל 6,000 חומרים מאתרים חופשיים כמו AmbientCG, PolyHaven, CGBookCase, ShareTexture, TextureCan, ומעט תוכן של האמן Julio Sillet. משם הם סיננו ידנית חומרים מטושטשים והשאירו רק חומרים באיכות 4K שניתן לרצף. מתוך 3,736 חומרים נקיים, הם יצרו הרחבה על ידי מיזוג חומרים בעלי היגיון משותף כדי להגיע למספר הסופי. המטא-דאטה כולל תגיות, מקור, רישיון ושיטת לכידה, אך רק לחלק קטן יש שם יוצר, תיאור טקסטואלי או מידות פיזיות בסנטימטרים.

מתאים ל

  • יצירת חומרי תלת-ממד

    אימון מודלים שמייצרים מפות PBR שלמות מתוך תמונת קלט יחידה או מתוך תגיות טקסט.

  • הפקת נתונים סינתטיים

    רינדור אובייקטים וסצנות תלת-ממד עם חומרים בריכוז גבוה לצורכי אימון מודלי סגמנטציה.

  • סיווג טקסטורות

    זיהוי וקטלוג של חומרים ומאפייני שטח על בסיס שיטות הלכידה והתגיות של המאגר.

איפה זה נופל

הטקסט שמלווה את החומרים דל מאוד ומופיע באנגלית בלבד. רק ל־572 חומרים יש תיאור מילולי, מה שמגביל מאוד אימון ישיר של מודלי טקסט לתמונה בלי להסתמך בעיקר על תגיות קצרות. בנוסף, רק ל־358 דגימות יש נתון על גודל פיזי אמיתי, ולרוב החומרים אין שיוך שם יוצר. המאגר נשען על סינון ידני של איכות ועל ערבוב מלאכותי של חומרים, כך שחלק מהדגימות הן תוצר סינתטי ולא סריקה מהעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

החומרים נאספו ממקורות ברישוי CC0 ו־CC-BY, אך אין למאגר כולו רישיון רשמי אחד. מותר להשתמש בחלקים שמוגדרים כנחלת הכלל, אבל עבור חומרים שמסומנים תחת CC-BY חובה לתת ייחוס ליוצר המקורי לפי המטא-דאטה.

כמה שוקל המאגר ואיך הכי נכון להוריד אותו?

המאגר כולל 451 קבצים ברזולוציית 4K וחלוקה לקובצי Parquet רבים. יוצרי המאגר מזהירים שהזרמה ישירה מהשרת אטית, ולכן מומלץ לבצע הורדה מלאה לדיסק המקומי לפני תחילת העבודה.

האם יש במאגר תמיכה בעברית?

לא. כל התגיות, התיאורים והמטא-דאטה כתובים באנגלית בלבד. אם המטרה היא לאמן מודל שמגיב להנחיות בעברית, תצטרכו לתרגם את התיאורים והתגיות באופן עצמאי.

איך החומרים נאספו ונבדקו?

החוקרים הורידו מעל 6,000 חומרים מאתרים חופשיים כמו AmbientCG ו־PolyHaven. הם סיננו ידנית חומרים עם טשטוש והשאירו רק טקסטורות 4K שניתן לרצף, ולאחר מכן הוסיפו שילובים של חומרים קיימים כדי להרחיב את המגוון.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets של פייתון, ללא צורך בבקשת גישה מיוחדת. הנתונים מחולקים לקובצי Parquet, עם מאות קבצים במאגר הכולל. היוצרים מציינים במפורש שהזרמת הנתונים ברשת אטית מאוד, ולכן כדאי להוריד ולשמור אותם מקומית לפני האימון. השדות החשובים לעבודה הם מפות הטקסטורה השונות וקובצי ה־Height שנשמרים כערוץ בודד של 16-ביט.

from datasets import load_dataset

ds = load_dataset("gvecchio/MatSynth")

הרישיון

בעמוד המאגר הראשי לא מוגדר רישיון אחיד, אך לפי התיעוד החומרים נאספו ממקורות תחת רישיונות CC0 ו־CC-BY. המשמעות היא שאין רישיון גורף פשוט. לפני שמשתמשים במאגר לפיתוח מוצר מסחרי או לאימון מודל שיופץ הלאה, חייבים לבדוק את שדה הרישיון בכל רשומה בנפרד ולוודא מתן קרדיט לחומרים שמקורם ב־CC-BY.

הרישיון המלא ב־Hugging Face ↗