GPT
H

HLE-Verified

קוד פתוח

skylenage-aiרישיון לא דווח2026-02-13

גרסה מבוקרת ומסודרת של מבחן HLE שנועדה לבחון יכולות חשיבה מורכבות. היא פותרת טעויות בתשובות ובנימוקים שנמצאו בבנצ'מרק המקורי ומספקת שקיפות מלאה לגבי כל תיקון.

  • 46,993הורדות בחודש
  • 19לייקים

מה זה

המאגר מכיל 2,500 שאלות ברמת קושי גבוהה מאוד מתחומי המתמטיקה, הפיזיקה, הכימיה, הרפואה, מדעי המחשב ומדעי הרוח. כל רשומה כוללת את השאלה, התשובה הסופית, שרשרת הנימוק וסוג הבדיקה, ובמקרים של תיקון מופיעים גם הנתונים המקוריים של HLE. לצד התוכן יש מטא-דאטה מפורט שמגדיר בדיוק איפה נמצאה שגיאה, כמו טעות בתשובה הסופית או חוסר בהסבר, עם קודי שגיאה מובנים.

הפריטים מחולקים לשלוש קבוצות נפרדות על פי איכותם. קבוצת Gold כוללת 668 שאלות שנבדקו ונמצאו תקינות ללא צורך במגע. קבוצת Revision מכילה 1,143 שאלות שתוקנו תוך שמירה על כוונת הבדיקה המקורית, וקבוצת Uncertain כוללת 689 שאלות שלא ניתן היה לקבוע בוודאות אם הן תקינות על בסיס המידע הקיים. התהליך כולו שילב דגימות ממודלים שונים כדי לאתר חריגות, ואחריהן בדיקה ותיקון לפי מנגנון הכרעה שמרני.

מתאים ל

  • הערכת ביצועי מודלים

    הרצת מודלים מול קבוצת Gold כדי לקבל ציונים אמינים בלי עיוותים שמקורם בשאלות שגויות.

  • מבחני עמידות ובדיקת שגיאות

    שימוש בקבוצת Revision כדי לבחון איך המודל מתמודד עם ניסוחים מתוקנים מול המקור.

  • מחקר על אי-ודאות ודו-משמעות

    ניתוח קבוצת Uncertain כדי לפתח שיטות שמזהות שאלות פגומות או חסרות הגדרה מדויקת.

איפה זה נופל

החולשה העיקרית היא שחלק מהתיקונים עדיין עשויים להיות פתוחים לפרשנויות שונות, והקבוצה הלא ודאית נותרה לא פתורה ומחכה לבדיקות נוספות. בנוסף, הסתמכות על מודלים ככלי עזר לאיתור כשלים עלולה להכניס הטיות משל עצמה ולא מהווה הוכחה מוחלטת לנכונות. כמעט 28 אחוז מהשאלות במאגר מסומנות כלא מוכרעות, כך שאי אפשר לקחת את כל 2,500 הפריטים כמקור אמת מוחלט להשוואת מודלים. הטקסט כולו באנגלית, ויש עיוותים של פורמט שמורגשים בעיקר בכימיה ובמדעי המחשב.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון לא צוין בכרטיס המאגר. ללא הגדרה רשמית של תנאי השימוש, אין אישור מפורש להשתמש בחומרים למטרות מסחריות או להטמיע אותם במוצר. מומלץ לבדוק ישירות מול המפרסמים או להגביל את השימוש לצורכי מחקר בלבד.

האם השאלות כוללות עברית?

לא, המאגר מתמקד בתכנים אקדמיים באנגלית בלבד. כל השאלות, ההסברים והמטא-דאטה מנוסחים באנגלית. אם אתם מעריכים יכולות של מודל בשפה העברית, הנתונים כאן לא יספקו לכם מענה.

מה ההבדל בין המאגר הזה ל־HLE המקורי?

בבנצ'מרק המקורי התגלו בעיות של תשובות שגויות, ניסוחים לא שלמים וטעויות פורמט. המאגר הנוכחי בדק את כל 2,500 השאלות, תיקן מעל אלף מהן והפריד שאלות שעדיין בספק לקבוצה נפרדת. בנוסף, הוא כולל מטא-דאטה מפורט שמסביר מה בדיוק תוקן בכל סעיף.

איך אפשר לדעת אילו שאלות נחשבות בטוחות להערכה נקייה?

עבור השוואה סטנדרטית ואמינה של מודלים מומלץ להשתמש בקבוצת Gold שכוללת 668 שאלות שנבדקו במלואן. שאר השאלות מתאימות לבדיקות רגישות או למחקר על זיהוי שגיאות, אבל הן כוללות תיקונים או אי-ודאות שלא מתאימים ללוח תוצאות רשמי.

איך טוענים

הנתונים מחולקים ל־26 קבצים בפורמט Parquet, שכוללים חלוקה לחלקים נפרדים עבור כל תת-מאגר. אפשר לטעון ישירות דרך ספריית datasets בלי צורך באישור גישה מיוחד. בעבודה עם הנתונים כדאי להסתכל על השדה Verified_Classes כדי לסנן את הקבוצה הרצויה, ולהשתמש באובייקט verify_meta_info שמפרט את תקינות השאלה, הפתרון והתשובה. שדה canary נועד לוודא שהחומרים האלה לא ייכנסו בטעות לתוך אימון של מודלים עתידיים.

from datasets import load_dataset

ds = load_dataset("skylenage-ai/HLE-Verified")

הרישיון

בעמוד המאגר לא דווח רישיון. המשמעות היא שמבחינה משפטית אין הרשאה מפורשת לשימוש מסחרי, להפצה מחדש או לשילוב באימון מודלים של חברות. מי שבונה מוצר מסחרי או מפרסם תוצאות צריך לקחת בחשבון את חוסר הבהירות הזו מול היוצרים המקוריים של המבחן ומול מפרסמי הגרסה הזו.

הרישיון המלא ב־Hugging Face ↗