GPT
B

boolq

קוד פתוח

googlecc-by-sa-3.02022-03-02

שאלות כן ולא אמיתיות שנשאלו באופן טבעי, יחד עם פסקאות טקסט ותשובה בוליאנית. המאגר מתאים למי שרוצה לבדוק יכולת הסקה לוגית של מודל מעבר לחיפוש מילות מפתח.

  • 192,528הורדות בחודש
  • 103לייקים

מה זה

המאגר כולל 15,942 דוגמאות של שאלות כן ולא שנאספו בסביבה חופשית ללא הנחיה מוקדמת, מה שגורם להן להיראות כמו שאלות אמיתיות שאנשים מחפשים ולא כמו תרגילי מבחן מלאכותיים. כל רשומה במאגר מורכבת משלשה של שאלה, פסקת מקור שמכילה את המידע הדרוש כדי להכריע בה, והתשובה הסופית שהיא ערך בוליאני של אמת או שקר. לעיתים מופיעה גם כותרת הדף כהקשר נוסף, והמבנה כולו מזכיר משימות קלאסיות של הסקה בשפה טבעית.

בחלוקה הפנימית הזמינה כאן יש שני חלקים בלבד, אימון שכולל 9,427 דוגמאות ואימות שכולל 3,270 דוגמאות. הכרטיס המקורי לא מפרט את תהליך הסינון המדויק, שיטת התיוג או זהות המתייגים, ומפנה למאמר המחקרי מ־2019 לצורך קבלת הפרטים הטכניים המלאים על שלבי ההפקה של הנתונים.

מתאים ל

  • הערכת מודלי שפה

    בדיקת יכולת המודל להבין הקשר מורכב ולענות נכון בכן או לא על שאלות שנשאלו באופן טבעי.

  • אימון מסווגי טקסט

    כוונון מודלים למשימות סיווג זוגות טקסט של שאלה ופסקה והכרעה האם התוכן מאמת את השאלה.

  • ולידציה למערכות RAG

    בדיקה האם רכיב השליפה מספק קטע טקסט שמספיק למודל כדי להכריע בצורה חד משמעית.

איפה זה נופל

המאגר כולו באנגלית בלבד, ואין בו שום ייצוג לעברית. בנוסף, מדובר בנתונים שפורסמו במקור במאמר מ־2019, כך שהעובדות המופיעות בפסקאות עשויות להיות ישנות ולא רלוונטיות לנושאים שהשתנו מאז. הכרטיס עצמו משאיר את רוב הסעיפים ריקים ולא מפרט הטיות חברתיות או תרבותיות שקיימות בטקסטים, ולכן חובה לבדוק ידנית את איכות התוכן לפני שמסתמכים עליו.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. אם המטרה היא לעבוד בעברית, תצטרכו לתרגם את השאלות והפסקאות או לחפש מאגר ייעודי אחר.

האם מותר להשתמש בו לפרויקט מסחרי?

הרישיון מאפשר שימוש מסחרי, אך כולל דרישת ייחוס ודרישת שיתוף זהה שמחייבת הפצה של נגזרות תחת אותו רישיון. המשמעות לגבי משקלי מודל שאומן על הדאטה שנויה במחלוקת משפטית.

כמה מקום ומשאבים צריך כדי להריץ אותו?

מדובר באחד המאגרים הקלים ביותר שיש. קובצי ההורדה שוקלים פחות מ־9 מגה בייט ובסך הכל הוא תופס פחות מ־17 מגה בייט בדיסק, כך שניתן לטעון אותו תוך שניות על כל מחשב אישי.

איך נאספו השאלות במאגר?

השאלות נאספו מתוך שאילתות חיפוש אמיתיות של משתמשים שלא קיבלו הנחיה מוקדמת. לאחר מכן הוצמדו להן פסקאות טקסט רלוונטיות מתוך דפי אינטרנט כדי לקבוע תשובה של נכון או לא נכון.

איך טוענים

ההורדה מהירה מאוד וכל הקבצים שוקלים פחות מ־9 מגה בייט, כך שכל המאגר תופס כ־16.59 מגה בייט בלבד בדיסק. הנתונים מחולקים לקובצי פרקט פשוטים ואין שום צורך באישור גישה מיוחד, הרשמה מוקדמת או מפתח גישה כדי למשוך אותם למחשב או לשרת.

בפועל עובדים רק עם שלושה שדות בסיסיים, שהם מחרוזת השאלה, מחרוזת הפסקה שממנה גוזרים את ההקשר, ושדה התשובה שמחזיר ערך בוליאני. בגלל המשקל הזעיר שלו, הוא נטען ישירות לזיכרון בלי שום צורך בעיבוד מקדים מורכב או בתשתיות אחסון כבדות.

from datasets import load_dataset

ds = load_dataset("google/boolq")

הרישיון

המאגר מופץ תחת רישיון cc-by-sa-3.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, אך חובה לתת קרדיט מתאים ליוצרים המקוריים. הבעיה המרכזית היא סעיף השיתוף הזהה, שמחייב שכל יצירה נגזרת או שינוי של המאגר יופצו תחת אותו הרישיון בדיוק. לגבי מודלים שאומנו עליו, המעמד המשפטי של שיתוף זהה אינו חד משמעי, ולכן מומלץ לבדוק זאת היטב עם ייעוץ משפטי לפני אימון מודל מסחרי סגור.

הרישיון המלא ב־Hugging Face ↗