GPT
S

SpreadsheetBench

קוד פתוח

KAKA22cc-by-sa-4.02025-08-04

המאגר מרכז 912 שאלות אמיתיות מפורומים של אקסל כדי לבחון מודלי שפה על משימות גיליון מורכבות. הוא מיועד למי שרוצה לבדוק סוכנים חכמים מול קבצים אמיתיים ולא מול טבלאות נקיות וסינתטיות.

  • 19,334הורדות בחודש
  • 15לייקים

מה זה

הרשומות במאגר מבוססות על שאלות שמשתמשים העלו בפורומים מקוונים על אקסל, יחד עם גיליונות הנתונים המקוריים שלהם. במקום טבלאות ישרות ונקיות, הקבצים כאן כוללים טבלאות מרובות באותו גיליון, מבנים לא סטנדרטיים ורכיבים שאינם טקסט. המאגר כולל 912 הוראות עבודה שמכסות פעולות שונות, החל מחיפוש ושליפה ועד סיכום, הדגשה, עריכה ומחיקה.

בסך הכל יש כאן 2,729 מקרי מבחן, כאשר לכל הוראה יש בממוצע שלושה קבצי בדיקה שונים שנועדו לוודא שהפתרון מחזיק מעמד גם כשהערכים בגיליון משתנים. המבנה מחולק להוראות ברמת התא ולהוראות ברמת הגיליון כולו. הקבצים מחולקים לארכיבים שכוללים גרסה מלאה של 912 מקרים לצד גרסה מאומתת של 400 מקרים.

מתאים ל

  • הערכת סוכני קוד ואקסל

    בדיקה מעשית של יכולת סוכני בינה מלאכותית לקרוא, לתקן ולמלא נתונים בקובצי אקסל אמיתיים.

  • מבחן ביצועים למודלי שפה

    מדידת יכולת ההסקה של מודלים מול טבלאות מורכבות, מבנים מקוטעים וערכים שאינם טקסט בלבד.

  • אימון מודלים למשרד

    לימוד מודלים לביצוע פקודות גיליון נפוצות כמו שליפת מידע, סיכום והדגשת תאים לפי הוראות טבעיות.

איפה זה נופל

כל השאלות נלקחו מפורומים ברשת, מה שאומר שהשפה כמעט בוודאות אנגלית בלבד ואין כאן ייצוג לעבודה בעברית או במבנה מימין לשמאל. המשימות קשות מאוד, ובדיקות מראות שאפילו סוכן ChatGPT הגיע לדיוק של 45.5 אחוז בלבד. המבנה מבוסס על קובצי אקסל וקריאות מקומיות, כך שזה לא מתאים לטעינה ישירה בסגנון שורת טקסט אחת, ודורש תשתית שמסוגלת לקרוא ולכתוב קבצים בינאריים.

אותה משפחה

SpreadsheetBench יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר כולל עברית או תמיכה בטבלאות מימין לשמאל?

הנתונים נאספו מפורומים מקוונים של אקסל, ולפי התיעוד מדובר בתוכן באנגלית בלבד. אין אזכור לעברית או לתמיכה בגיליונות מימין לשמאל.

האם מותר להשתמש בזה למוצר מסחרי?

הרישיון cc-by-sa-4.0 מאפשר שימוש מסחרי בכפוף למתן קרדיט. החלק המאתגר הוא דרישת השיתוף באותם תנאים, שמחייבת להפיץ נגזרות של הדאטהסט תחת אותו רישיון חופשי.

איך המאגר בודק אם הפתרון של המודל נכון?

במקום לבדוק התאמת טקסט, המערכת פועלת כמו פלטפורמת בדיקת קוד. לכל הוראה יש בממוצע שלושה קובצי קלט שונים וקובצי פתרון תואמים, והמודל נבדק על התוצאה הסופית בגיליון.

במה הוא שונה מדאטהסטים אחרים של טבלאות?

רוב המאגרים משתמשים בטבלאות סינתטיות ופשוטות. כאן מדובר בבעיות אמיתיות של משתמשים שכוללות טבלאות מרובות באותו גיליון, עיצובים לא סטנדרטיים ומניפולציות מורכבות ברמת התא והגיליון.

איך טוענים

הנתונים יושבים בארכיבי tar.gz דחוסים, והגישה אליהם חופשית לחלוטין ללא צורך באישור מיוחד. בפנים תמצאו קובץ JSON שמכיל את המזהה, ההוראה המילולית, סוג המניפולציה, מיקום התא לתשובה והנתיב לקבצים. לצד הנתונים יש תיקיות עם קובצי אקסל של קלט וקובצי פתרון מוכנים, וכדי להריץ את ההערכה צריך להגדיר סביבה לפי המאגר בגיטהאב.

from datasets import load_dataset

ds = load_dataset("KAKA22/SpreadsheetBench")

הרישיון

הרישיון הוא cc-by-sa-4.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, אך חובה לתת קרדיט ליוצרים. סעיף השיתוף באותם תנאים מחייב שכל נגזרת של המאגר שתפיצו תשוחרר תחת אותו רישיון בדיוק. אם אתם רק מעריכים מודל קיים זה לא משפיע על המודל, אך שילוב הנתונים באימון עשוי לעורר שאלות לגבי מעמדו של המודל המאומן.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗