GPT
M

Metacognitive

קוד פתוח

FINAL-Benchapache-2.02026-02-21

  • functional-metacognition
  • self-correction
  • reasoning
  • benchmark
  • error-recovery

מבחן ביצועים ממוקד שבודק אם מודל מזהה טעויות של עצמו ומתקן אותן בזמן אמת. מתאים למי שרוצה לבחון יכולות תיקון עצמי מעבר לדיוק של תשובה סופית.

  • 581הורדות בחודש
  • 101לייקים

מה זה

המאגר כולל בדיוק 100 משימות מקוריות באנגלית, שנכתבו במיוחד כדי למנוע זיהום נתונים ואינן לקוחות ממבחנים קיימים. כל רשומה כוללת פרומפט, תיאור של התנהגות מטא-קוגניטיבית מצופה, ומלכודת קוגניטיבית ספציפית שהוטמנה בו בכוונה, כמו הטיית אישור, עוגן או הזנחת שיעור הבסיס.

המשימות מחולקות לפי שלוש רמות קושי: 50 משימות ברמה הגבוהה ביותר של בעיות פתוחות, 33 ברמת מומחה, ו־17 ברמה מתקדמת. בנוסף הן פרוסות על פני 15 תחומים שונים, כשהמובילים שבהם הם רפואה עם 11 משימות, מתמטיקה ולוגיקה עם 9 משימות, ואתיקה עם 9 משימות.

מתאים ל

  • הערכת תיקון שגיאות

    בדיקת יכולת המודל לזהות הנחות שגויות ולתקן את הפלט שלו.

  • מדידת ביטחון עצמי

    כימות הפער שבין היכולת להצהיר על חוסר ודאות לבין פעולת התיקון.

  • השוואת מודלים מתקדמים

    הרצת מבחן מובנה לבדיקת עמידות מול מלכודות חשיבה מוכרות.

איפה זה נופל

זהו סט הערכה בלבד ולא דאטהסט לאימון. עם 100 דוגמאות בלבד ובאנגלית בלבד, אי אפשר להשתמש בו ל־fine-tuning, והוא לא יגיד לכם שום דבר על ביצועי המודל בעברית. בנוסף, ההערכה מסתמכת על מודל שופט לפי רובריקה מוגדרת מראש, מה שעלול להכניס הטיות שיפוט שאינן תמיד עקביות.

שאלות
נפוצות

האם אפשר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, רישיון Apache 2.0 מתיר במפורש שימוש מסחרי מלא. עליכם רק לציין קרדיט ליוצרים המקוריים ולצרף את נוסח הרישיון.

כמה שוקל הדאטהסט והאם צריך להמתין לאישור גישה?

המאגר פתוח לציבור ללא צורך באישור ומכיל 100 שורות בלבד בקובץ jsonl. ההורדה אורכת שניות ספורות ואינה דורשת משאבי אחסון מיוחדים.

האם הדאטהסט רלוונטי לבדיקת מודלים בעברית?

לא. כל 100 המשימות מנוסחות באנגלית בלבד ומותאמות לשפה זו. כדי לבדוק עברית תצטרכו לתרגם ולהתאים את המלכודות הלוגיות באופן עצמאי.

במה הוא שונה ממבחנים קיימים כמו MMLU או GPQA?

מבחנים רגילים בודקים רק אם התשובה הסופית נכונה. כאן מוטמנת מלכודת מכוונת בכל שאלה, והציון מודד את תהליך זיהוי המלכודת והתיקון של המודל.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של Hugging Face מהנתיב FINAL-Bench/Metacognitive בפיצול train. הגישה חופשית לחלוטין ללא צורך באישור, והמאגר זעיר ויושב בקובץ FINAL_Bench_100.jsonl. השדות המרכזיים להרצה הם prompt, שמכיל את השאלה למודל, ו־expected_behavior יחד עם hidden_trap לצורך שיפוט איכות התיקון העצמי.

from datasets import load_dataset

ds = load_dataset("FINAL-Bench/Metacognitive")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי ומחקרי מלא, כולל שינוי והפצה מחדש. החובה היחידה היא מתן קרדיט מתאים ליוצרים וצירוף עותק של הרישיון המקורי. השימוש אינו מחייב אתכם לשחרר מוצרים או מודלים שבדקתם תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗