GPT
R

ResearchClawBench

קוד פתוח

InternSciencemit2026-03-27

  • autonomous-agents
  • scientific-research
  • benchmark

המאגר כולל סביבות עבודה מדעיות מלאות לבדיקה אם סוכני קוד מסוגלים לשחזר מחקרים אמיתיים. הוא בודק ביצוע מחקר שלם מנתוני גלם ועד כתיבת דוח, ולא ידע תיאורטי.

  • 26,346הורדות בחודש
  • 16לייקים

מה זה

המאגר מכיל עשרות משימות מדעיות שמבוססות על מאמרים שפורסמו בעשרה תחומים שונים, ובהם אסטרונומיה, כימיה, פיזיקה, מדעי כדור הארץ ומדעי המוח. כל משימה כוללת נתוני ניסוי גולמיים, חומרי רקע והוראות עבודה מובנות שנבנו וסוננו ידנית על ידי מומחים בכל תחום.

המבנה של כל רשומה כולל סביבת קבצים ייעודית עם נתונים בפורמטים מגוונים כמו טבלאות, מערכים וקבצים בינאריים ייעודיים. לכל משימה מצורף מחוון הערכה מפורט עם קריטריונים משוקללים, מילות מפתח טכניות וציון דרך שחוקרים אנושיים שחזרו בהצלחה כדי לוודא שהמשימה אכן פתירה.

מתאים ל

  • בנצ'מרק לסוכני מחקר

    בדיקת היכולת של סוכנים לכתוב קוד, להפיק גרפים ולהסיק מסקנות מדעיות מנתוני גלם.

  • הערכת שחזור ניסויים

    מדידה כמותית של דיוק תוצאות שמפיק מודל בהשוואה למאמרים מדעיים שפורסמו.

  • פיתוח כלי קוד אוטונומיים

    אימון ובדיקה של מודלים לפעולה מרובת שלבים בתוך סביבות עבודה מורכבות של קבצים.

איפה זה נופל

ההערכה כולה מבוססת על מודל שפה כשופט, מה שמכניס תלות ישירה ביכולות הניתוח ובהטיות של אותו מודל. כל החומרים, המאמרים וההוראות כתובים באנגלית מקצועית בלבד, ואין נתונים בעברית. היקף המשימות קטן יחסית וממוקד במחקרים ספציפיים, כך שהוא מודד יכולת שחזור של משימות מוגדרות מראש ולא יצירתיות מדעית רחבה או אימות מעבדתי פיזי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון MIT מתיר שימוש מסחרי מלא, כולל אימון מודלים והרצת מערכות הערכה פנימיות בארגון. הדרישה היחידה היא לכלול את הצהרת הרישיון וזכויות היוצרים המקוריות בעת הפצה.

האם יש במאגר תכנים בעברית?

לא. כל המשימות, המאמרים, המחוונים וקובצי ההוראות כתובים באנגלית בלבד. הנתונים עצמם הם נתוני מחקר בינלאומיים בפורמטים מדעיים אוניברסליים.

איך הנתונים נאספו ונבדקו?

מומחים בחרו מאמרים מדעיים עדכניים בעשרה תחומים, חילצו את המשימות המרכזיות ובנו מחוון בדיקה. לאחר מכן, חוקרים אנושיים שיחזרו את התוצאות בפועל כדי לוודא שכל משימה אכן ניתנת לפתרון מלא מהנתונים שסופקו.

מה ההבדל בינו לבין מבחני קוד רגילים?

רוב המבחנים בודקים כתיבת פונקציות בודדות או ידע עובדתי סגור. כאן נותנים לסוכן מרחב עבודה עם נתוני גלם ומודדים אם הוא מסיים מחקר שלם ומגיע למסקנות המקוריות של המאמר.

איך טוענים

המאגר מיועד לעבודה מקומית ולא לטעינה קלאסית של טבלה אחת. מורידים את המשימות באמצעות סקריפט ייעודי או שיבוט המאגר, וכל תיקיית משימה כוללת קובץ הגדרות בשם task_info.json ונתוני גלם. הגישה פתוחה ואין צורך באישור מיוחד. כדי להריץ את ההערכה מפעילים סביבת פייתון מקומית שמריצה שרת פלאסק ומתחברת למודל שופט דרך מפתחות גישה מתאימים בקובץ סביבה.

from datasets import load_dataset

ds = load_dataset("InternScience/ResearchClawBench")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי, הפצה ושימוש פרטי ללא תשלום, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. אין חובה לשתף נגזרות באותו רישיון, ומותר לאמן עליו מודלים חופשיים או מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗