GPT
A

agent-finance-reasoning

קוד פתוח

snorkelaiapache-2.02025-06-27

  • finance

המאגר מרכז עקבות ריצה של סוכני בינה מלאכותית שפותרים שאלות פיננסיות מורכבות מתוך דוחות שנתיים. הוא מתאים למי שרוצה לבחון יכולות הסקה וקריאה לכלים בעולם הפיננסי האמיתי.

  • 372הורדות בחודש
  • 68לייקים

מה זה

הנתונים מתעדים ריצות של סוכנים שנבנו בתבנית ReAct מעל LangGraph, מול משימות ניתוח פיננסי מורכבות. בכל אינטראקציה הסוכן נדרש לענות על שאלה שמתבססת על טבלאות מתוך דוחות שנתיים מסוג 10-K, שהומרו למסד נתונים יחסי. כדי לספק מענה מדויק, הסוכן מבצע בממוצע שתים עשרה פעולות של הסקה וקריאה לכלי SQL שמחלצים את המידע הדרוש מהטבלאות.

הבסיס למאגר הוא שבעים ותשע שאלות ותשובות שנבנו בשיתוף מומחים פיננסיים מרשת המומחים של Snorkel, מתוך מטרה לדמות שאלות אותנטיות של אנליסטים. מתוכן הופקו שלוש מאות חמישים ושבע רשומות, שמציגות ריצות מלאות של מודלים מובילים כמו o3, o4-mini, Claude 4 Sonnet, Claude 4 Opus ו־Gemini 2.5 Pro. כל הנתונים מרוכזים בקובץ יחיד, המהווה מדגם ראשוני שמיועד להתרחב בעתיד.

מתאים ל

  • הערכת סוכנים פיננסיים

    בדיקת היכולת של סוכן אוטונומי לבצע שאילתות SQL מורכבות על דוחות כספיים.

  • ניתוח עקבות הסקה

    למידה מתוך ריצות של מודלים חזקים כדי לשפר שרשראות חשיבה בתהליכים מרובי שלבים.

  • כיול שופט אוטומטי

    השוואת פלטים של מודלים מול תשובות מומחים בעזרת מערכות שיפוט מבוססות שפה.

איפה זה נופל

החיסרון הברור ביותר הוא הגודל. שלוש מאות חמישים ושבע רשומות שמבוססות על שבעים ותשע שאלות בלבד לא יספיקו לאימון מודל, אלא רק להערכה נקודתית או בדיקת התנהגות. מעבר לזה, המאגר מוגבל אך ורק לשפה האנגלית ולדוחות 10-K של חברות אמריקאיות, כך שאין כאן שום ייצוג לדיווחים מקומיים או לחברות ישראליות. הנתונים מתבססים על שנות דיווח ספציפיות, והיוצרים מציינים בעצמם שהמידע יתיישן אם לא יעודכן בקביעות. אם אתם בונים מערכת שצריכה להתמודד עם שוק מקומי או נתונים עדכניים, תצטרכו לאמת את הממצאים מול חומרים אחרים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר זמין תחת רישיון Apache 2.0 שמתיר שימוש מסחרי מלא. אתם נדרשים רק לתת קרדיט ליוצרים מבית Snorkel AI ולצרף את עותק הרישיון.

כמה המאגר שוקל ואיך הוא מובנה?

הוא קל מאוד ומכיל שלוש מאות חמישים ושבע רשומות בלבד בתוך קובץ train.parquet יחיד. ההורדה אורכת שניות ספורות והרשומות נטענות ישירות כטבלה לזיכרון.

האם יש במאגר שאלות או מסמכים בעברית?

לא. כל השאלות, התשובות והדוחות הפיננסיים נכתבו באנגלית בלבד ומבוססים על דוחות 10-K של חברות אמריקאיות.

מאיפה הגיעו השאלות והתשובות במאגר?

השאלות נוסחו בשיתוף רשת מומחים פיננסיים של Snorkel כדי לדמות עבודת אנליסט אמיתית. הנתונים עצמם הגיעו ממידע ציבורי מתוך טבלאות של דוחות כספיים שהומרו למסד נתונים.

איך טוענים

טוענים את המאגר ישירות בספריית datasets הרגילה של פייתון עם הנתיב snorkelai/agent-finance-reasoning עבור פיצול ה־train. אין כאן שום תהליך אישור, הרשמה מיוחדת או דרישה לחשבון סגור, והמאגר פתוח לכולם. כל המידע יושב בקובץ parquet יחיד שנמצא במאגר לצד תמונת דוגמה וקובץ הסבר, כך שמדובר בנפח זעיר של מאות שורות שיורד למחשב תוך שניות בודדות. בפנים תמצאו את עקבות הריצה המלאות של האינטראקציות, כולל המטא-דאטה, שאילתות ה־SQL וקריאות הכלים של המודלים השונים שנבדקו.

from datasets import load_dataset

ds = load_dataset("snorkelai/agent-finance-reasoning")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי ומחקרי חופשי, שינוי של הנתונים והפצה מחודשת שלהם. הרישיון דורש מתן קרדיט ליוצרים המקוריים ושמירה על הודעת הרישיון, אך אינו מחייב אתכם לשחרר מודלים שאומנו עליו באותו האופן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗