GPT
K

knights-and-knaves

קוד פתוח

K-and-Kcc-by-nc-sa-4.02024-10-21

  • logical
  • reasoning

חידות היגיון קלאסיות של אבירים ונוכלים שנועדו לבדוק יכולות הסקת מסקנות של מודלי שפה. המאגר מתאים למי שרוצה לבחון יכולת לוגית טהורה מול מספר משתתפים משתנה.

  • 1,685הורדות בחודש
  • 38לייקים

מה זה

המאגר מבוסס על בעיות היגיון שבהן כל דמות היא אביר שדובר תמיד אמת, או נוכל שמשקר תמיד. מטרת המשימה היא לענות על שאלות ולהבין את זהות הדוברים על סמך הטענות שלהם. המבנה מחולק לפי מספר האנשים שמופיעים בחידה, משני אנשים ועד שמונה אנשים, מה שמשנה את רמת המורכבות החישובית והלוגית.

הקובציים מאורגנים בפורמט jsonl וכוללים חלוקה לערכות אימון ומבחן. לפי המידע שסופק, המאגר נועד לשמש מבחן ביצועים לבדיקת הסקת מסקנות ומדידת שינון במודלים, אך הכרטיס אינו מפרט את הליך הייצור המדויק או שיטות הסינון שבוצעו על הרשומות.

מתאים ל

  • בנצ'מרק הסקת מסקנות

    הרצת בדיקות השוואתיות למודלים כדי לראות איך הם מתמודדים עם היגיון פורמלי.

  • בדיקת השפעת עומס משתנים

    הערכת הנפילה בביצועי המודל ככל שמספר הדמויות בחידה עולה משתיים לשמונה.

  • מדידת שינון במודלי שפה

    בחינה אם המודל מסיק מסקנות באופן עצמאי או מסתמך על תבניות מוכרות מהאימון.

איפה זה נופל

החיסרון הברור ביותר הוא השפה, כל הנתונים באנגלית בלבד ואין תמיכה בעברית. מעבר לכך, הכרטיס לא מציין כיצד נבנו הדוגמאות או אם יש מנגנון שמונע דליפת נתונים מאימונים קודמים. זהו מאגר ייעודי לחידות לוגיות פשוטות, לכן הוא לא משקף שפה טבעית חופשית, דיאלוגים מורכבים בעולם האמיתי או שימוש במוצר קצה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-sa-4.0 שאינו מתיר כל שימוש מסחרי. המאגר מיועד למחקר ולניסויים בלבד, וכל נגזרת מחויבת להישאר תחת אותם תנאים מגבילים.

האם המאגר כולל עברית?

לא, השפה היחידה במאגר היא אנגלית. כדי לבחון מודלים בעברית תצטרכו לתרגם את החידות באופן עצמאי, תוך שמירה על הכללים הלוגיים של הטקסט.

איך מחולקים הקבצים בפועל?

הנתונים מחולקים לפי רמות קושי שנמדדות במספר הדמויות בכל חידה, משני אנשים ועד שמונה. המאגר כולל תיקיות מבחן ואימון עם קובצי jsonl נפרדים לכל כמות אנשים.

איך נוצר הדאטהסט?

כרטיס הדאטהסט לא מפרט את אופן יצירת הנתונים או את תהליך הסינון. הוא מפנה למאמר מחקרי על שינון של מודלי שפה ולמאגר קוד חיצוני, אך אינו מרחיב בדף עצמו מעבר לכך.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון המזהה K-and-K/knights-and-knaves. הגישה חופשית ואין צורך לבקש אישור מיוחד. בקריאה לפונקציה מגדירים את הפיצול הרצוי, כאשר בוחרים בין מבחן לאימון, ומציינים את החתך לפי כמות האנשים, למשל 2ppl עד 8ppl. הקבצים עצמם שמורים בפורמט jsonl.

from datasets import load_dataset

ds = load_dataset("K-and-K/knights-and-knaves")

הרישיון

הרישיון הוא cc-by-nc-sa-4.0. המשמעות היא איסור מוחלט על שימוש מסחרי, חובת מתן קרדיט ליוצרים, ודרישה שכל יצירה נגזרת תופץ תחת אותו רישיון בדיוק. אם תאמנו מודל על הנתונים האלה, לא תוכלו לשלב אותו במוצר שמייצר הכנסה או לגבות עליו תשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗