GPT
F

Finch

קוד פתוח

FinWorkBenchcc-by-3.02025-11-30

  • agent
  • workflow
  • multimodal
  • spreadsheet
  • pdf

מבחן ביצועים של 172 תהליכי עבודה חשבונאיים ופיננסיים מורכבים סביב אקסל ומסמכים עסקיים. מתאים למי שבונה סוכני AI ורוצה לבדוק התמודדות עם לוגיקה תאגידית מסורבלת ואמיתית ולא עם טבלאות נקיות.

  • 6,382הורדות בחודש
  • 28לייקים

מה זה

המאגר כולל 172 תהליכי עבודה מלאים המבוססים על 1,710 קובצי גיליונות אלקטרוניים ו־27 מיליון תאים בסך הכל. הנתונים נשענים בעיקר על תכתובות דואל וגרסאות קבצים מתוך מאגר אנרון וקורפוס EUSES, לצד מסמכים מ־2024 ו־2025 מגופים ממשלתיים בקנדה ובבריטניה, הבנק העולמי ובתי השקעות. מומחים השקיעו מאות שעות בניתוח שרשראות שינויים, ניסוח הוראות מפורטות והגדרת פלטים רצויים.

ברוב המכריע של המקרים, כ־92.4 אחוזים, התהליך אינו נשען על קובץ בודד אלא על ממוצע של שמונה גיליונות, ומגיע במקרים קיצוניים עד 91 קבצים מקושרים. הרשומות מחברות בין גיליונות עם נוסחאות עמוקות, מיזוגי תאים, כותרות מרובות רמות, קובצי PDF וסריקות, הדורשים חילוץ מידע, הצלבת מקורות, חישוב ובניית מודלים.

מתאים ל

  • בנצ'מרק לסוכני קוד ואקסל

    בדיקת היכולת של מודלים לקרוא נוסחאות עמוקות, לתקן תאים מקושרים ולעדכן מודלים פיננסיים מרובי גיליונות.

  • הערכת תהליכי עבודה רב-שלביים

    מדידת ביצועים של מודלים בהפעלת שרשרת כלים ארוכה הכוללת חיפוש ברשת, שליפת מידע והצלבת מסמכים.

  • מבחן הבנת מסמכים רב-מודאליים

    בחינת יכולת המודל להמיר נתונים מטבלאות סרוקות ומקובצי PDF ישירות לתוך גיליונות נתונים פעילים.

איפה זה נופל

החומר כולו באנגלית ומתבסס על תרבות ניהול ורגולציה תאגידית אמריקאית, בריטית וקנדית. אין כאן שום ייצוג לעברית, לכללי דיווח ישראליים או לפורמטים מקומיים. מעבר לכך, חלק משמעותי מבוסס על מסמכי אנרון הישנים, כך שלמרות שנוספו מקורות מעודכנים מ־2024 ו־2025, חלק מדפוסי הנתונים היסטוריים. היוצרים גם מציינים במפורש שאסור לכלול את המאגר בסט אימון, כך שהוא מיועד אך ורק להערכה ובנצ'מרק.

שאלות
נפוצות

האם המאגר מתאים לפיתוח כלי פיננסי לשוק הישראלי?

לא באופן ישיר. כל ההוראות, המונחים החשבונאיים והמסמכים הם באנגלית ומבוססים על תקנים ופרקטיקות בינלאומיות, ללא התאמה למיסוי או לחוקים בישראל. הוא יעזור לבדוק יכולות אנליטיות כלליות, אך לא יישר קו עם צורכי השוק המקומי.

האם מותר לאמן מודלים על הנתונים?

הרישיון המשפטי הרשמי הוא CC-BY 3.0 שמאפשר שימוש רחב, אך יוצרי המאגר ציינו במפורש שאין להכניס את הדאטהסט לקובצי אימון. המטרה היא לשמור עליו כמבחן הערכה נקי ולא מזוהם למודלים עתידיים.

כמה המשימות האלה קשות למודלים חזקים?

קשות מאוד. במבחנים שערכו החוקרים, GPT 5.1 הגיע ל־38 אחוזי הצלחה בלבד ודרש בממוצע 16 דקות למשימה, ו־Claude Sonnet 4.5 השיג 25 אחוזים בלבד. הפער נובע מהצורך בלוגיקה מורכבת שחבויה בתוך נוסחאות ולא רק בטקסט הגלוי.

במה הדאטהסט שונה ממבחני טבלאות רגילים?

רוב המבחנים בודקים קריאת טבלה בודדת או שליפת ערך ישיר. כאן מדובר בתהליך עבודה מלא שדורש מעבר בין קובצי אקסל שונים, הבנת הנחות יסוד עסקיות והתמודדות עם מבנה נתונים לא אחיד ומבולגן.

איך טוענים

הנתונים מחולקים לרשומות בפורמט JSONL, כשלכל משימה יש מזהה, הוראה באנגלית, רשימת קובצי מקור, קישורי הורדה, סוג המשימה והתחום העסקי. הגישה חופשית ללא צורך באישור מיוחד. כדי להריץ בדיקה תצטרכו להוריד את קובצי האקסל והמסמכים המקושרים ולהשתמש בקוד ההערכה שפורסם ב־GitHub, תוך ניהול סביבה שיודעת לעבד קובצי גיליונות ו־PDF במקביל.

from datasets import load_dataset

ds = load_dataset("FinWorkBench/Finch")

הרישיון

המאגר מופץ תחת רישיון CC-BY 3.0. הרישיון מאפשר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט מתאים ליוצרים. עם זאת, יוצרי הדאטהסט מבקשים מפורשות לא לכלול אותו בקובצי אימון של מודלים כדי לא לזהם את מבחן הביצועים.

הרישיון המלא ב־Hugging Face ↗