GPT
C

ChemBench

קוד פתוח

jablonkagroupmit2025-01-14

  • chemistry
  • benchmark
  • evaluation
  • ChemBench
  • manually-curated

מעל 2,700 שאלות שנכתבו בידי מומחים לבדיקת יכולות של מודלי שפה בכימיה ומדעי החומרים. הוא מתאים למי שרוצה לבחון יכולת הסקה מדעית מורכבת במקום להסתפק במבחני ידע כלליים.

  • 7,598הורדות בחודש
  • 26לייקים

מה זה

המאגר מכיל שאלות רב ברירה ושאלות פתוחות בתשעה תחומים מרכזיים, בהם כימיה אנליטית, כימיה אורגנית, מדעי החומרים, הנדסה כימית, ותרכובות בהקשר של רעילות ובטיחות. מומחים בתחום הכימיה ניסחו ובדקו את השאלות ידנית כדי לוודא דיוק מדעי, והן חולקו לפי רמות קושי, מיומנויות נדרשות כמו חישוב או אינטואיציה, ונושאי משנה.

כל רשומה כוללת מזהה ייחודי, מחרוזת מניעת זליגה לאימון, תיאור הרקע, שאלת הקלט ותשובות היעד. בנוסף יש חלוקה לפי מדדי הערכה מומלצים, כמו התאמת מחרוזת מדויקת או שגיאה מוחלטת ממוצעת, וכן סימון אם השאלה ניתנת לפתרון בידי אדם עם או בלי כלי חישוב חיצוניים.

מתאים ל

  • הערכת מודלי שפה בכימיה

    הרצת סדרת מבחנים להשוואת ביצועים של מודלים שונים בפתרון שאלות ידע והסקה במדעי החומרים.

  • בדיקת שימוש בכלים חיצוניים

    בחינת היכולת של סוכני בינה מלאכותית לשלב מחשבונים ותוכנות ייעודיות לפתרון בעיות מספריות.

  • בקרת איכות לפני הטמעה

    ולידציה של מודלים לפני שימוש בתעשייה הכימית והתרופתית כדי לוודא הבנה בסיסית בבטיחות.

איפה זה נופל

היוצרים אוסרים במפורש על שימוש בנתונים לאימון או לכוונון עדין, ומייעדים את המאגר להערכה בלבד כדי לא לזהם את מבחני הביצועים. כל השאלות כתובות באנגלית בלבד, כך שהוא לא יעזור לבדיקת ביצועים בעברית. בנוסף, הכיסוי מוגבל לנקודת הזמן שבה נכתבו השאלות, והמדדים האוטומטיים מתקשים לפעמים לתפוס את מלוא העומק של הסקה כימית פתוחה ומורכבת.

שאלות
נפוצות

האם מותר להשתמש במאגר כדי לאמן מודל?

מבחינה משפטית רישיון MIT מתיר זאת, אך החוקרים שפרסמו את המאגר אוסרים זאת במפורש בהנחיות שלהם. שימוש בנתונים האלה לאימון יפגע ביכולת להשתמש בהם למדידה השוואתית הוגנת מול מודלים אחרים בעתיד. לצורך אימון עדיף לפנות למאגרים ייעודיים אחרים.

האם המאגר כולל תוכן בעברית?

המאגר כולו מנוסח באנגלית בלבד ואין בו תרגום לעברית. אם המטרה שלכם היא להעריך ביצועים של מודל על מושגים ותרגילים כימיים בשפה העברית, תצטרכו לתרגם את השאלות באופן עצמאי. יש לקחת בחשבון שתרגום מונחים מקצועיים עלול לשנות את אופי השאלה.

איך נאספו השאלות במאגר?

השאלות לא נאספו באופן אוטומטי מהרשת אלא נכתבו ונבדקו ידנית בידי אנשי מקצוע ומומחים בתחומי הכימיה ומדעי החומרים. הצוות סיווג כל שאלה לפי תחום מדויק, רמת קושי וכישורים נדרשים. בנוסף נעשתה ולידציה על ידי בודקים אנושיים כדי להבטיח את איכות התשובות והתאמתן.

איך טוענים

הנתונים מחולקים לתשע תצורות שונות לפי תחומי הכימיה בקובצי Parquet, ללא צורך באישור גישה מיוחד. אפשר לעבוד ישירות עם ספריית chembench הייעודית בפייתון לצורך הרצה והערכה מול מודלים, או למשוך את התצורות הרצויות ישירות מהאבינג פייס. יש לשים לב למבנה של שדה examples שמכיל את נתוני הקלט והתשובות, ולשדה preferred_score שמגדיר את המטריקה הנכונה להשוואה.

from datasets import load_dataset

ds = load_dataset("jablonkagroup/ChemBench")

הרישיון

המאגר מופץ ברישיון MIT שמתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט מתאים ליוצרים וללא אחריות מצידם. אף על פי שהרישיון החוקי מתיר זאת, יוצרי המאגר מבקשים בפירוש לא להשתמש בנתונים לאימון מודלים כדי לשמור על תוקף ההערכות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗