GPT
C

CritPt

קוד פתוח

CritPt-Benchmarkapache-2.02025-09-29

המאגר מרכז 70 בעיות פיזיקה מורכבות ברמת מחקר אקדמי שנכתבו מאפס כדי לבחון יכולות חשיבה של מודלי שפה. הוא מיועד למי שרוצה למדוד ביצועים מדעיים אמיתיים על שאלות שטרם הופיעו באינטרנט.

  • 5,909הורדות בחודש
  • 27לייקים

מה זה

המאגר כולל 70 משימות מחקר שנבנו על ידי יותר מ־50 חוקרי פיזיקה ממעל 30 מוסדות בעולם, בהם דוקטורנטים, פוסט-דוקטורנטים ופרופסורים. כל בעיה דרשה בממוצע מעל 40 שעות של פיתוח ובקרה כדי לשקף עומק של פרויקט מחקרי מלא המתאים לתלמידי מחקר מתחילים. השאלות מוגדרות היטב, פתירות באמצעות ידע ציבורי זמין בלבד, וכוללות תשובות חד-משמעיות שאינן מאפשרות ניחוש וניתנות לבדיקה אוטומטית מותאמת לפורמטים פיזיקליים.

התוכן מכסה 11 תחומי מחקר שונים בפיזיקה מודרנית. החלק הבולט ביותר הוא פיזיקת חומר מעובה עם 25 אתגרים, ואחריו מידע ומדע קוונטי עם 17 אתגרים, ופיזיקה אטומית, מולקולרית ואופטית עם 14 אתגרים. תחומים נוספים כוללים פיזיקה של אנרגיות גבוהות, פיזיקה מתמטית, אסטרופיזיקה, תרמודינמיקה, פיזיקה גרעינית, דינמיקה לא ליניארית, מכניקת זורמים וביופיזיקה, כאשר כמעט מחצית מהבעיות משלבות מספר תחומים במקביל.

מתאים ל

  • הערכת מודלי חשיבה

    בדיקת יכולות הסקת מסקנות מתקדמות של מודלים גדולים מול בעיות מחקר חדשות לחלוטין.

  • השוואת ביצועים מדעית

    מדידה והשוואה של דיוק מודלים שונים בכלים ממוחשבים על גבי בעיות פיזיקה רב-שלביות.

  • בחירת כלי בינה לחוקרים

    בחינה מעשית של התאמת מודלי שפה שונים לשמש כעוזרי מחקר בפרויקטים פיזיקליים אמיתיים.

איפה זה נופל

זהו לא מאגר אימון אלא סט מבחן קטן מאוד, והיוצרים אוסרים במפורש להשתמש בו לאימון מודלים כדי לא לקלקל את אמינות הבדיקה. בנוסף, הוא מכיל 70 שאלות בלבד, כולן בשפה האנגלית וברמה תאורטית ומחקרית גבוהה ביותר. מודלים מובילים נכשלים בו כמעט לחלוטין, כאשר הדיוק הגבוה ביותר בלוח התוצאות מגיע ל־12.6 אחוז בלבד, ומודלים רבים מקבלים אפס עגול. אם אתם מחפשים שאלות פיזיקה בסיסיות, תרגול לימודי או כיסוי בעברית, המאגר הזה פשוט לא רלוונטי.

שאלות
נפוצות

האם מותר לאמן מודלים על הדאטהסט?

לא. למרות שהרישיון הטכני הוא Apache 2.0, החוקרים דורשים מפורשות לא להשתמש בנתונים לאימון כדי למנוע דליפת מידע. המאגר נועד לשמש כמבחן הערכה בלבד.

האם יש במאגר תוכן בעברית?

אין במאגר עברית בכלל. כל 70 הבעיות והניסוחים נכתבו באנגלית מדעית על ידי חוקרים ממוסדות בינלאומיים.

כמה המאגר שוקל והאם הוא דורש משאבים כבדים?

המאגר קל מאוד וכולל קובץ פרקט יחיד עם 70 שאלות בלבד. הורדת הנתונים לוקחת שניות בודדות ולא דורשת שום תשתית אחסון מיוחדת.

מאיפה הגיעו השאלות שבתוך הדאטהסט?

השאלות נכתבו במיוחד על ידי צוות של מעל 50 מומחי פיזיקה על בסיס המחקרים שלהם. מדובר בבעיות מקוריות שלא פורסמו באינטרנט לפני שחרור המאגר.

איך טוענים

המאגר פתוח להורדה ישירה ללא צורך בהרשמה מיוחדת או באישור גישה. הנתונים שמורים בקובץ פרקט יחיד בשם train-00000-of-00001.parquet לצד קובץ התיעוד, כך שמדובר בנפח זעיר של עשרות רשומות בלבד. כדי להעריך מודלים על גבי האתגרים הללו, היוצרים מפנים למאגר קוד ייעודי בגיטהאב שמכיל את תשתית הבדיקה והציונים האוטומטית שפותחה עבור הפורמטים של התשובות.

from datasets import load_dataset

ds = load_dataset("CritPt-Benchmark/CritPt")

הרישיון

הרישיון המוגדר במאגר הוא Apache 2.0, שמתיר עקרונית שימוש, שינוי והפצה גם לצרכים מסחריים תחת מתן קרדיט והצהרת שינויים. יחד עם זאת, מחברי המאגר מצהירים בטקסט במפורש כי הנתונים מיועדים למבחן בלבד וחל איסור להשתמש בהם לאימון מודלים או לפרסם את הפתרונות שלהם ברשת. שימוש בנתונים לאימון יפר את כוונת היוצרים המקורית ויפגע באמינות המבחן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗