GPT
L

LeMat-Bulk

קוד פתוח

LeMaterialcc-by-4.02024-12-06

  • chemistry

מאגר ענק של מיליוני מבנים גבישיים מאוחדים מ־Materials Project, Alexandria ו־OQMD. הוא חוסך את הצורך לסנכרן ידנית פרמטרים של חישובי DFT בין מקורות שונים.

  • 4,700הורדות בחודש
  • 29לייקים

מה זה

המאגר מאחד תוצאות חישובי תורת פונקציונל הצפיפות (DFT) עבור חומרים מוצקים נפחיים (bulk). כל רשומה מייצגת מבנה גבישי שעבר אופטימיזציה, וכוללת וקטורי סריג, מיקומי אטומים בקואורדינטות קרטזיות, אנרגיה, כוחות, מאמצים, מומנטים מגנטיים וסיווג לפי חבורות סימטריה מרחביות במבנה תואם Optimade.

היוצרים שלפו מידע משלושה מקורות עיקריים: Alexandria שתורמת את רוב החומרים, OQMD ו־Materials Project. כפילויות סוננו באמצעות אלגוריתם טביעת אצבע מבנית (BAWL) המבוסס על גרפים של קשרים, סימטריה והרכב כימי, כאשר במקרה של כפילות נשמר המבנה בעל האנרגיה הנמוכה בלבד.

הנתונים מחולקים למספר תתי-מאגרים לפי הפונקציונל החישובי: compatible_pbe שהוא ברירת המחדל ומכיל מעל חמישה מיליון מבנים, לצד compatible_pbesol ו־compatible_scan הקטנים יותר, ותת-מאגר all שמכיל את כל המבנים ללא סינון תאימות.

מתאים ל

  • אימון פוטנציאלים בין-אטומיים

    אימון מודלי למידת מכונה לחיזוי כוחות ואנרגיות של חומרים מגוונים על בסיס תת-המאגר compatible_pbe.

  • סריקה וגילוי חומרים חדשים

    סינון מועמדים לתכונות פיזיקליות לפי הרכב כימי ומבנה גבישי מתוך מיליוני דגימות מאוחדות.

  • הערכת ביצועי מודלים מבניים

    בדיקת דיוק של מודלים גנרטיביים לגבישים מול נתוני אמת המכילים מגוון רחב של סימטריות מרחביות.

איפה זה נופל

המאגר מכיל רשומות רבות עם כוחות אטומיים חזקים או חישובים שאינם בהכרח מתכנסים, שכן היוצרים בחרו במודע לא לסנן אותן. חובה להפעיל סינון עצמאי על שדה forces לפני שימוש במודל. תת-המאגר all כולל חוסר התאמות קריטי בפרמטרים חישוביים כמו פסאודו-פוטנציאלים ותיקוני Hubbard U, במיוחד סביב רשומות מ־OQMD. בנוסף, חומרים המכילים איטרביום מ־Materials Project הוסרו לחלוטין בשל בעיות פוטנציאל, ותיקוני אנרגיה אחידים אינם מיושמים על כלל הנתונים בגרסה זו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא כולל אימון מודלים קנייניים. התנאי היחיד הוא מתן קרדיט וייחוס הולם ליוצרי המאגר ולמאגרי המקור שמהם נלקחו הרשומות לפי המזהים שלהן.

באיזה תת-מאגר כדאי להשתמש לאימון מודל?

עדיף להשתמש ב־compatible_pbe שהוא גם ברירת המחדל. תת-המאגר הזה מסנן אי-התאמות בפרמטרים חישוביים בין מקורות המידע השונים ומבטיח שהאנרגיות והמבנים ניתנים להשוואה ולמידה עקבית.

האם הנתונים מוכנים לשימוש ישיר בלי עיבוד נוסף?

לא. היוצרים לא סיננו רשומות עם כוחות אטומיים גבוהים מאוד או בעיות התכנסות בחישוב. תצטרכו להגדיר סף סינון על שדה forces ולוודא שהמבנים יציבים מספיק למטרות שלכם.

מה ההבדל בין המאגר הזה לבין הורדה ישירה מ־Materials Project?

המאגר מאחד את Materials Project יחד עם Alexandria ו־OQMD לכדי פורמט אחיד של Optimade, ומסיר כפילויות בין המאגרים. בנוסף, הוא פותר חוסר תאימות בפרמטרים של חישובי DFT כדי שתוכלו לאמן על נתונים משולבים ממקורות שונים.

איך טוענים

טוענים את המאגר ישירות בספריית datasets של Hugging Face תוך ציון תת-המאגר הרצוי, למשל compatible_pbe. הגישה חופשית לגמרי וללא צורך באישור מוקדם. הנתונים שמורים בקובצי parquet המחולקים למקטעים, וניתן להמיר אותם למבנה נתונים של Pandas. בעבודה עם הנתונים כדאי לשים לב לשדות elements, lattice_vectors, cartesian_site_positions, וכן לשדות הפיזיקליים כמו energy ו־forces.

from datasets import load_dataset

ds = load_dataset("LeMaterial/LeMat-Bulk")

הרישיון

המאגר מופץ ברישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו דורש שיתוף תחת אותו רישיון עבור המודלים או הפיתוחים שלכם. עם זאת, חלה חובת ייחוס ברורה: בעת שימוש ברשומות ספציפיות נדרש לתת קרדיט ולצטט את מאגרי המקור המתאימים (Materials Project, Alexandria או OQMD) לפי המזהה של כל רשומה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗