GPT
D

DABstep

קוד פתוח

adyencc-by-4.02024-12-21

אפשר גם להריץ אותו בדפדפן בלי להתקין דבר.

מאגר משימות שבוחן יכולת של סוכני בינה מלאכותית להסיק מסקנות מורכבות בכמה שלבים. הוא מכיל קובצי הקשר מעולם התשלומים ומתאים למי שרוצה להעריך ביצועי מודלים על בעיות עסקיות מציאותיות.

  • 109,299הורדות בחודש
  • 57לייקים

מה זה

המאגר מחולק לשלושה חלקים עיקריים שנועדו להריץ ולהזין לוח תוצאות ציבורי. החלק המרכזי נקרא tasks והוא זה שמכיל את המשימות שסוכנים צריכים לפתור. שני החלקים הנוספים, submissions וגם task_scores, מרכזים את ההגשות שנבדקו ואת הציונים שניתנו להן במסגרת הבנצ'מרק.

התוכן עצמו מבוסס על נתוני הקשר שנמצאים בתיקייה ייעודית. לפי שמות הקבצים, יש שם מידע עסקי מעולם התשלומים, כמו טבלאות קודי קטגוריית בית עסק בפורמט CSV, נתוני סליקה של מדינות שונות, קובצי עמלות ונתוני סוחרים בפורמט JSON, לצד קובצי הסבר ומדריכים בפורמט Markdown. המפרסמים לא פירטו בכרטיס איך בדיוק הם אספו או סיננו את הנתונים האלה, אבל המבנה מרמז על הדמיה או עיבוד של סביבת תשלומים תאגידית טיפוסית שדורשת הצלבת מקורות שונים כדי להגיע לתשובה נכונה.

מתאים ל

  • בדיקת סוכני הסקה

    הרצת סוכנים על משימות הדורשות קריאה, ניתוח והצלבה של כמה קובצי נתונים לקבלת מענה.

  • השוואה ללוח תוצאות

    הערכת ביצועי מודל שפה מול תוצאות קיימות בבנצ'מרק של עולם התשלומים.

  • פיתוח כלי עיבוד נתונים

    בחינת יכולת של סוכן לפרסר קובצי JSON וטבלאות CSV מורכבות באופן עצמאי.

איפה זה נופל

הכרטיס לא מספק פרטים טכניים מהותיים. אין תיעוד של שיטות האיסוף, אין פירוט על הטיות אפשריות בנתונים, ולא ברור אם הנתונים מבוססים על מידע אמיתי שעבר אנונימיזציה או על יצירה סינתטית. המאגר פורסם בסוף 2024, אך גיל הנתונים עצמם לא מוגדר.

כל הקבצים והתיעוד כתובים באנגלית, ללא תמיכה בעברית או התאמה למערכות תשלומים ישראליות מקומיות. בנוסף, חסר מידע על גודל ההורדה המדויק בנפח דיסק. לא הייתי משתמש בזה לאימון מודל לתחום התשלומים, אלא רק להערכה השוואתית של סוכנים על משימות הסקה מורכבות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לצרכים מסחריים?

כן, הרישיון שדווח הוא cc-by-4.0. הרישיון הזה מאפשר שימוש מסחרי מלא, כולל שינוי הנתונים ושילובם. החובה היחידה היא מתן קרדיט מתאים למפרסמי המאגר.

האם הנתונים כוללים עברית?

לא, הנתונים כולם באנגלית. קובצי ההקשר, הטבלאות והמשימות מבוססים על מונחים וסביבה בינלאומית באנגלית. אין פה התייחסות לשפה העברית או לשוק המקומי.

מה בדיוק המאגר מכיל ואיך הוא נאסף?

המאגר כולל אלפי קבצים שמחולקים למשימות, קובצי הקשר של עולם התשלומים ומידע על הגשות קודמות. המפרסמים לא ציינו בכרטיס את שיטת האיסוף המדויקת, ולכן לא ידוע אם מדובר בנתונים אמיתיים או מסונתזים.

האם צריך לבקש הרשאה מיוחדת כדי להוריד אותו?

לא, המאגר זמין לגישה ישירה ופתוחה לכולם. אפשר לטעון אותו בקלות דרך ספריית datasets בפייתון ללא צורך בהרשמה מוקדמת או אישור מיוחד.

איך טוענים

אתם טוענים אותו ישירות דרך ספריית datasets בפייתון בעזרת הפקודה load_dataset, כשמעבירים את שם המאגר, מגדירים את הפיצול tasks ומציינים את הספליט default. אין צורך לבקש אישור גישה מראש כי המאגר פתוח לחלוטין לציבור.

המאגר כולל אלפי קבצים נפרדים בתיקיית ההקשר, כך שהסוכן שלכם יצטרך לקרוא קובצי JSON, CSV וטקסט כדי לפתור כל משימה. כדאי לוודא מראש שהסוכן שלכם יודע לפרסר את הפורמטים האלה ולחבר ביניהם, ולקחת בחשבון את המבנה המדויק שנדרש עבור קובץ הפתרונות אם אתם מתכננים להגיש תוצאות ללוח הציבורי.

from datasets import load_dataset

ds = load_dataset("adyen/DABstep")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי ומאפשר לשנות את הנתונים או להתבסס עליהם, בתנאי שאתם נותנים קרדיט מתאים למפרסמים ומציינים שינויים אם נעשו. אין דרישה לשתף תוצרים תחת אותו רישיון, ומודל שהוערך או אומן על החומר לא כבול להפצה פתוחה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗