GPT
S

SpreadsheetBench-v2

קוד פתוח

KAKA22mit2026-03-31

מבחן ביצועים לסוכני בינה מלאכותית שמתמודדים עם משימות מורכבות בגיליונות אלקטרוניים עסקיים. הוא בודק עבודה על קבצים מרובי גיליונות, בניית מודלים פיננסיים ותיקון תקלות רוחביות.

  • 13,525הורדות בחודש
  • 16לייקים

מה זה

המאגר מרכז תרחישי עבודה שלמים באקסל ולא מניפולציות בודדות של תאים. הנתונים מתמקדים בעולם הפיננסי העסקי, ודורשים מהסוכן לבצע רצף פעולות ארוך, לחבר בין גיליונות שונים בתוך אותו קובץ, ולהפיק תוצרים מוגמרים כמו דוחות, תיקוני נוסחאות או גרפים.

התרחישים מחולקים למשימות של מידול פיננסי מורכב, ויזואליזציה של נתונים, ואיתור ותיקון תקלות על פני עשרה סוגי שגיאות מוגדרים. במשימות הדיבאגינג נדרשים מאות שינויי תאים בממוצע, ובמידול הפיננסי נדרשים מעל אלף שינויים, מה שהופך את הבדיקה לכבדה ומורכבת בהרבה מבנצ'מרקים פשוטים של שורת פקודה בודדת.

מתאים ל

  • בדיקת סוכני קוד ואקסל

    מדידת יכולת הסוכן לעבוד על חוברות עבודה מרובות גיליונות ולבצע אלפי שינויים מתואמים.

  • הערכת מידול פיננסי

    בחינת יכולות של מודלים לחבר דוחות רווח והפסד, מאזנים ותזרימי מזומנים בקובץ אחד.

  • בדיקת תיקון שגיאות

    מדידת ביצועים באיתור ותיקון עשרה סוגי תקלות נפוצות בגיליונות נתונים עסקיים.

איפה זה נופל

הכרטיס ממוקד כולו בתחום הפיננסי המקצועי, כך שהוא לא מייצג שימושים כלליים או טבלאות פשוטות. אין שום תיעוד לגבי תמיכה בשפות שאינן אנגלית, וסביר להניח שכל המונחים והנוסחאות מותאמים לטרמינולוגיה בינלאומית מערבית. בנוסף, משימות שדורשות אלפי עריכות תאים מייצרות עלויות טוקנים כבדות מאוד בזמן ריצה, ולא בטוח שכל סוכן יידע להחזיק הקשר ארוך כזה בלי לקרוס.

אותה משפחה

SpreadsheetBench יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון הוא MIT ולכן אין מגבלה על שימוש מסחרי. עליכם רק לצרף את תנאי הרישיון והקרדיט המקורי.

האם יש תמיכה בעברית או בגיליונות מימין לשמאל?

הכרטיס אינו מציין תמיכה בעברית. המשימות מבוססות על עולם העסקים והפיננסים באנגלית, וסביר להניח שלא נבדקו תרחישי RTL.

במה הוא שונה ממבחני ביצועים אחרים לטבלאות?

רוב המבחנים בודקים יצירת נוסחה יחידה או שליפה מתא בודד. כאן מדובר על תהליך עבודה שלם שדורש מאות עד אלפי עריכות תאים לאורך כמה גיליונות במקביל.

איך מקבלים גישה לקבצים?

המאגר פתוח לחלוטין בהאגינג פייס ואינו דורש אישור מוקדם. מורידים ישירות את קובצי ה־zip שמופיעים ברשימת הקבצים ופורסים אותם.

איך טוענים

הנתונים לא מגיעים כטבלה רגילה שמושכים בפקודה אחת של ספריית datasets, אלא בארכייוני zip שיושבים במאגר. תצטרכו להוריד את הקבצים, כמו spreadsheetbench-v2.zip או קובצי הדוגמה, ולפרוס אותם מקומית. אין צורך בבקשת גישה מיוחדת, המאגר פתוח לחלוטין. בפנים תמצאו את חוברות העבודה המורכבות ומסלולי הפעולות להרצה ולהשוואה.

from datasets import load_dataset

ds = load_dataset("KAKA22/SpreadsheetBench-v2")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לבדוק איתו מודלים פנימיים ולשלב אותו במערכות סגורות, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. אין כאן חובת שיתוף של מודל שתאמנו או תבדקו עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗