GPT
T

tabular-benchmark

קוד פתוח

inria-soda2022-10-27

אוסף של עשרות מערכי נתונים טבלאיים שנאספו מ־OpenML לצורכי סיווג ורגרסיה. הוא מיועד למי שרוצה להשוות ביצועים בין מודלים מבוססי עצים לרשתות נוירונים על נתונים מציאותיים.

  • 3,438הורדות בחודש
  • 51לייקים

מה זה

המאגר מרכז נתונים טבלאיים סטנדרטיים שנאספו בעיקר מ־OpenML, לצד מקורות כמו Kaggle. הרשומות מייצגות בעיות אמיתיות מתחומים שונים כמו מחירי דיור, אשראי, תחבורה, בריאות ופיזיקה, כאשר כל קובץ מציג עמודות בעלות אופי שונה ולא אותות מחיישנים דומים. האוצרים סיננו החוצה סדרות עתיות, משחקים כמו שחמט ופוקר, מערכים קטנים מדי עם פחות מ־3,000 דוגמאות או פחות מ־4 עמודות, ומערכים קלים מדי שמודל פשוט הגיע בהם לביצועים הקרובים לרשתות עמוקות או לעצים.

התוכן מחולק לארבע תיקיות לפי סוג המשימה והמשתנים: סיווג על משתנים מספריים בלבד, סיווג הכולל גם משתנים קטגוריאליים, רגרסיה על משתנים מספריים בלבד, ורגרסיה המשלבת משתנים קטגוריאליים. כל קובץ מייצג משימה נפרדת עם כמות נתונים שונה, החל מאלפי שורות בודדות במערכים כמו abalone ועד למיליוני רשומות במערכים כמו delays_zurich_transport או Higgs.

מתאים ל

  • השוואת אלגוריתמים

    בדיקת ביצועים שיטתית בין מודלים מבוססי עצים לרשתות עמוקות על מגוון רחב של משימות טבלאיות.

  • ולידציה של שיטות קידוד

    בחינת טכניקות שונות לעיבוד מקדים של משתנים קטגוריאליים על תיקיות המבחן המעורבות.

  • בנצ'מרק לאופטימיזציה

    מדידת זמני ריצה ויעילות זיכרון של ספריות למידת מכונה על קבצים בגדלים שונים.

איפה זה נופל

חלק גדול מהקבצים מייצג נתונים אמריקאיים או אירופיים ישנים, כמו נתוני מוניות בניו יורק מ־2016 או תחבורה מציריך, ללא שום ייצוג להקשר ישראלי או מקומי. בנוסף, המאגר כולל מערכים שנויים במחלוקת כמו compas שכוללים הטיות חברתיות מובנות, ומערכים מסוימים שבהם שמות העמודות הוסתרו במקור. האוצרים הורידו בכוונה סדרות עתיות ומערכים קטנים, כך שהבנצ'מרק הזה לא מתאים לבדיקת מודלים על נתונים דלילים או על תחזיות של תלות בזמן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הכרטיס הראשי אינו מגדיר רישיון כללי. מכיוון שהקבצים לוקטו ממקורות שונים ברשת, עליכם לגשת לקישורי המקור ב־OpenML עבור כל קובץ ספציפי ולבדוק את תנאי הרישיון שלו בנפרד לפני שימוש במסגרת מסחרית.

האם הנתונים כוללים עברית או הקשר מקומי?

הנתונים אינם מכילים עברית כלל. מדובר בטבלאות ממקורות בינלאומיים, ברובן באנגלית, שמתעדות אזורים כמו ארצות הברית, ברזיל או שווייץ.

מה מבדיל את האוסף הזה ממאגרי טבלאות אחרים?

האוצרים ביצעו סינון מוקפד שפסל בעיות פשוטות מדי שמודלים ליניאריים פותרים בקלות, וכן פסלו תלויות בזמן ומשחקים. כל משימה כאן נבחרה במיוחד כדי לייצג אתגר ממשי שבו מודלים מורכבים נמדדים מול עצי החלטה.

איך ניגשים לנתונים מתוך המאגר?

הגישה מתבצעת ברמת הקובץ הבודד ולא כחבילה אחת שלמה. מעבירים לפקודת הטעינה את נתיב התיקייה ושם הקובץ, למשל ציון נתיב של קובץ רגרסיה מתוך ספריית reg_cat.

איך טוענים

טוענים כל משימה ישירות מתוך המאגר באמצעות שורת קוד יחידה בספריית datasets של Hugging Face, תוך ציון הנתיב לקובץ ה־CSV המבוקש בתוך התיקייה המתאימה. אין צורך באישור גישה מוקדם או בהרשמה מיוחדת, הקבצים פתוחים להורדה מיידית. שמות הקבצים והעמודות משתנים ממשימה למשימה, כך שחובה לבדוק בכל קובץ בנפרד מהי עמודת המטרה ואיזה עיבוד מקדים נדרש עבור העמודות הקטגוריאליות.

from datasets import load_dataset

ds = load_dataset("inria-soda/tabular-benchmark")

הרישיון

המאגר עצמו לא מדווח על רישיון אחיד בכרטיס הנתונים. מאחר שמדובר באוסף של עשרות מערכים שונים שנלקחו מ־OpenML ומ־Kaggle, לכל קובץ מקור יש בפועל רישיון משלו. כל עוד לא בדקתם את הרישיון המקורי של הקובץ הספציפי שבו אתם משתמשים, מסוכן להכניס את הנתונים האלה לאימון מודל מסחרי או למוצר ייצורי.

הרישיון המלא ב־Hugging Face ↗