GPT
S

SuperGPQA

קוד פתוח

m-a-podc-by2025-02-20

מאגר שאלות ברמת תארים מתקדמים ב־285 תחומים שונים, שנועד לבחון מודלי שפה על ידע אקדמי מעמיק. הוא מרחיב את מבחני הידע הקיימים ומציב רף קשה בהרבה מרוב הבנצ'מרקים המוכרים.

  • 11,841הורדות בחודש
  • 93לייקים

מה זה

המאגר מכיל בין עשרת אלפים למאה אלף רשומות, ומיועד למשימות של יצירת טקסט והערכת ביצועים. רוב השאלות נכתבו במיוחד עבור הפרויקט הזה כדי לבדוק מומחיות ברמת תארים מתקדמים, אבל חלק קטן מהתוכן נלקח ועבר עיבוד מתוך מאגרים קיימים.

המקורות החיצוניים שמהם עובדו חלק מהנתונים כוללים מבחנים מוכרים מתחומי הרפואה כמו MedQA ו־MedMCQA, משפטים דרך LawBench, מתמטיקה תחרותית ואקדמית כמו Omni-Math ו־Putnam-AXIOM, מוזיקה ומבחני שאלות רב-ברירה כמו MMLU-Pro. החומרים מרוכזים בקובץ יחיד שמכיל את כלל השאלות והתשובות לצורך בדיקה עקבית של מודלים.

מתאים ל

  • בנצ'מרק למודלי שפה

    הרצת מבחני הערכה מקיפים ברמת תארים מתקדמים על מודלי בסיס שונים.

  • בדיקת יכולות מתמטיות

    בחינת פתרון בעיות מתמטיות קשות שמבוססות על Putnam ו־AIME.

  • אימות ידע רפואי ומשפטי

    מדידת הדיוק של המודל בתחומים מקצועיים מורכבים הדורשים התמחות.

איפה זה נופל

כל השאלות במאגר מנוסחות באנגלית בלבד, כך שהוא לא יעזור למי שבונה או בודק מודל ייעודי לעברית. בנוסף, הוא מורכב בחלקו מנתונים שעובדו ממאגרים קיימים, ולכן יש סיכון מסוים לזליגת מידע אם המודל שלכם כבר אומן על מקורות כמו MMLU או MedQA בעבר. מעבר לרשימת המקורות, דף המאגר לא מפרט תהליכי סינון, בקרת איכות אנושית או מגבלות ספציפיות על דיוק התשובות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

הרישיון העיקרי הוא ODC-BY שמתיר שימוש מסחרי עם מתן קרדיט. יחד עם זאת, חלק מהשאלות מבוססות על מאגרים חיצוניים אחרים, וחובה לוודא שרישיונות המקור שלהם אינם מגבילים שימוש מסחרי.

האם יש במאגר שאלות בעברית?

לא. המאגר כולו מוגדר וקיים באנגלית בלבד, ולא כולל שאלות או תרגומים לשפות אחרות.

איך המאגר הזה שונה מ־GPQA המקורי?

הוא מרחיב את היקף התחומים ל־285 דיסציפלינות שונות של תארים מתקדמים. בנוסף ליצירת תוכן חדש, הוא משלב שאלות מעובדות ממאגרים ממוקדים נוספים כמו בתחומי הרפואה והמתמטיקה.

כמה קשה להתחיל לעבוד איתו טכנית?

פשוט מאוד. כל המידע מרוכז בקובץ JSONL יחיד שניתן להוריד ישירות ולקרוא בכל שפת תכנות, בלי תהליכי אישור או הרשאות מיוחדות.

איך טוענים

טוענים את הנתונים ישירות מהקובץ SuperGPQA-all.jsonl שנמצא במאגר, או דרך ספריית הדאטהסטים הרגילה של פייתון. המאגר פתוח לציבור ללא צורך בהרשמה מוקדמת או באישור גישה מיוחד מהיוצרים, וכולל שלושה קבצים בלבד.

הפורמט מבוסס שורות JSON, מה שמאפשר להריץ הערכה על מודלים מקומיים או במחברת עבודה בלי תלויות מורכבות. כדאי להכיר את מבנה הרשומה כדי לחלץ את הטקסט והתשובות הנכונות לפני שמחברים את הקובץ לסקריפט ההערכה שלכם.

from datasets import load_dataset

ds = load_dataset("m-a-p/SuperGPQA")

הרישיון

המאגר מופץ תחת רישיון ODC-BY, שמתיר שימוש חופשי כולל שימוש מסחרי, בתנאי שנותנים קרדיט מלא ליוצרים. עם זאת, בגלל שהוא כולל קטעים שעובדו ממאגרים חיצוניים, אתם מחויבים לציית גם לתנאי הרישיון המקוריים של כל אחד מאותם מקורות לפני שאתם משלבים את התוכן באימון או במוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗