GPT
G

global-piqa-nonparallel

קוד פתוח

mrlbenchmarkscc-by-sa-4.02025-10-23

  • text

מאגר שאלות היגיון בריא שנכתבו ידנית ב־136 שפות. הוא מיועד לבחון אם מודלים מבינים מנהגים מקומיים ופיזיקה יומיומית, ולא רק אנגלית מתורגמת.

  • 6,186הורדות בחודש
  • 40לייקים

מה זה

המאגר כולל שאלות ברירה מרובה שנכתבו ידנית בידי יותר מ־350 חוקרים ברחבי העולם, ללא תרגום מכונה של שאלות קיימות. כל רשומה מורכבת מהנחיה קצרה, פתרון אחד נכון ופתרון אחד שגוי. כדי לפתור נכון נדרשת הבנה של תכונות חומרים, יחסים פיזיקליים, או ידע תרבותי.

החלק הזה אינו מקבילי, כלומר השאלות בכל שפה נבנו בנפרד. יותר ממחצית מהדוגמאות עוסקות במאכלים מקומיים, מנהגים ומסורות תרבותיות ספציפיות, מה שדורש מהמודל להכיר את ההקשר של שפת היעד ולא רק לתרגם מושגים מערביים.

בסך הכל המאגר מקיף 136 תתי-שפות, 18 משפחות שפה ו־24 מערכות כתב. החלוקה נעשית לפי קוד שפה ומערכת כתב, כך שכל שילוב מנוהל כקבצי נתונים נפרדים.

מתאים ל

  • הערכת מודלי בסיס

    בדיקת הסתברויות בפורמט cloze למודלים שאינם מכוונני הוראות.

  • הערכת מודלי שיחה והוראות

    מבחן בחירה מרובה A או B דרך תבנית פרומפט ייעודית.

  • מדידת ידע תרבותי

    בדיקת יכולת המודל לזהות מנהגים, מאכלים והקשר מקומי בשפות שונות.

איפה זה נופל

היוצרים אוסרים במפורש על אימון מודלים או יצירת נתונים סינתטיים מתוכו, כך שהוא מתאים להערכה בלבד. חצי מהשאלות תלויות בהקשר תרבותי מקומי מובהק, ולכן מודל בלי ידע ספציפי לשפה או לאזור ייכשל בהן גם אם יכולת ההיגיון הכללית שלו מצוינת. גודל המדגם משתנה בין השפות, ואין כאן נתוני אימון אלא בדיקה בלבד.

שאלות
נפוצות

האם מותר לאמן מודל על הדאטהסט?

לא. למרות רישיון CC BY-SA 4.0, היוצרים הבהירו שהם אוסרים לחלוטין על אימון מערכות בינה מלאכותית או יצירת דאטה סינתטי ממנו. השימוש מותר אך ורק להערכת ביצועים.

האם המאגר כולל עברית?

כן. המאגר מכיל תת-מאגר ייעודי לעברית תחת המזהה heb_hebr, שנכתב ידנית על ידי חוקרים.

מה ההבדל בין החלק הזה לחלק המקבילי?

החלק המקבילי מכיל שאלות אחידות ומתורגמות ללא תלות תרבותית. כאן, בחלק הלא מקבילי, מעל מחצית מהשאלות מתייחסות למנהגים, מאכלים ותרבות מקומית של אותה שפה.

איך מריצים הערכה מול המאגר?

אפשר להשתמש בספריית LM Evaluation Harness שבה המשימות כבר מוגדרות מראש. ההרצה תומכת בשני פורמטים, פורמט השלמה למודלי בסיס ופורמט יצירה למודלים מכוונני הוראות.

איך טוענים

טוענים את הנתונים דרך ספריית datasets על ידי ציון מזהה השפה והכתב, למשל heb_hebr לעברית או eng_latn לאנגלית, תחת פיצול test. המאגר פתוח לציבור ללא צורך באישור גישה מראש. הקבצים שמורים בפורמט tsv לפי שפות, והם מוכנים ישירות להרצה בהערכה אוטומטית דרך LM Evaluation Harness.

from datasets import load_dataset

ds = load_dataset("mrlbenchmarks/global-piqa-nonparallel")

הרישיון

המאגר מוגדר רשמית ברישיון CC BY-SA 4.0, שדורש ייחוס ושיתוף זהה. היוצרים הוסיפו תנאי מגביל משלהם שאוסר על אימון מודלים מכל סוג או יצירת דאטה סינתטי. אם המטרה שלכם היא אימון, אי אפשר להשתמש בו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗