GPT
S

simpleqa-verified

קוד פתוח

googlemit2025-09-22

  • factuality
  • parametric
  • memory
  • pretraining
  • posttraining

גוגל לקחו את מבחן העובדתיות של OpenAI, ניקו ממנו שגיאות וכפילויות והשאירו אלף שאלות מדויקות. הוא מיועד למי שרוצה לבדוק כמה מודל באמת זוכר בעל פה, בלי לנחש ובלי עזרים חיצוניים.

  • 3,837הורדות בחודש
  • 52לייקים

מה זה

המאגר מכיל 1,000 שאלות שנכתבו על ידי בני אדם כדי לבחון ידע פרמטרי קצר. גוגל דיפמיינד וגוגל ריסרץ' לקחו את המאגר SimpleQA המקורי שפורסם על ידי OpenAI, ותיקנו בו תיוגים שגויים, רעש, כפילויות של שאלות והטיות נושאיות. המטרה שלהם הייתה ליצור כלי הערכה מדויק יותר שלא סובל מבעיות תיוג ומקשה על המודל לזייף תשובות ארוכות.

כל שורה בקובץ כוללת את השאלה עצמה בשדה problem, את התשובה הנכונה בשדה answer, ואת המזהה המקורי מהמאגר של OpenAI. בנוסף, כל רשומה מסווגת לפי נושא וסוג תשובה, ומכילה לפחות שני קישורי מקור מאומתים בשדה urls שתומכים בתשובה. גוגל הוסיפו גם שני שדות מטא-דאטה חדשים, multi_step ו־requires_reasoning, שמציינים האם השאלה דורשת הצלבת מקורות שונים או הסקה מורכבת יותר.

מתאים ל

  • הערכת הזיות של מודל

    מדידה מדויקת של נטיית המודל להמציא עובדות כשהוא נדרש לספק תשובות קצרות וחד משמעיות.

  • מדידת זיכרון פרמטרי

    בדיקת כמות הידע העובדתי השמור במשקולות המודל ללא תלות במנועי חיפוש או במאגרי מידע חיצוניים.

  • השוואת ביצועים מול דוחות

    הרצת בדיקה מול לידרבורד קיים בקגל באמצעות פרומפט השפיטה הרשמי מבוסס GPT-4.1.

איפה זה נופל

המגבלה המרכזית שהחוקרים מציינים היא שאסור להפעיל את המבחן הזה לצד כלי חיפוש, שליפת מידע או RAG. עם גישה לרשת השאלות הופכות לפשוטות מדי לפתרון, וכל המטרה של המאגר היא לבדוק את מה שנצרב במשקולות המודל בלבד.

המאגר כולו באנגלית. אין בו נתונים בשפות אחרות, כך שהוא לא יעזור לכם לבדוק עובדות או ידע מקומי בעברית. בנוסף, מדובר באלף דוגמאות בלבד, כך שהוא מתאים להערכה ואימות, ולא לאימון מודלים.

שאלות
נפוצות

האם יש במאגר שאלות בעברית?

לא. המאגר מוגדר ומכיל שאלות בשפה האנגלית בלבד. אם המטרה שלכם היא לבחון ידע מקומי או יכולות שפה בעברית, המאגר הזה לא יספק מענה.

במה הוא שונה מ־SimpleQA המקורי של OpenAI?

גוגל ניקו בו שגיאות בתשובות, מחקו שאלות כפולות והוסיפו סיווג חדש לשאלות שדורשות היגיון והצלבת מידע. בנוסף, לכל תשובה צורפו לפחות שני מקורות רשת מאומתים ונבנה פרומפט שפיטה קפדני יותר.

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן. הדאטהסט שוחרר ברישיון MIT, שאינו מגביל שימוש מסחרי. עליכם רק לצרף את תנאי הרישיון והודעת זכויות היוצרים של המפרסמים.

האם כדאי להשתמש בו לאימון מודל?

לא. המאגר מכיל בדיוק 1,000 שאלות ומיועד לשמש כמבחן השוואתי בלבד. שימוש בו כחומר אימון יהרוס את היכולת שלכם להעריך את המודל בצורה אובייקטיבית.

איך טוענים

המאגר פתוח לציבור ואינו דורש אישור גישה מיוחד. הוא מגיע בקובץ פשוט בשם simpleqa_verified.csv, שניתן לטעון ישירות דרך ספריית datasets או עם pandas. השדות החשובים לעבודה הם problem להזנת הפרומפט למודל, ו־answer לבדיקה.

הבדיקה בפועל מתבססת על פרומפט שופט ייעודי שמריצים על מודל GPT-4.1. הפרומפט הזה שוחרר בקוד פתוח בקגל, והוא הותאם במיוחד כדי לכפות תשובות ישירות, למנוע ניחושים מרוחים בתשובות ארוכות, ולדייק בבדיקה של תשובות מספריות.

from datasets import load_dataset

ds = load_dataset("google/simpleqa-verified")

הרישיון

המאגר מופץ תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי ומחקרי חופשי, עריכה והפצה מחדש, כולל אימון או הערכה של מודלים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗