GPT
F

financebench

קוד פתוח

PatronusAIcc-by-nc-4.02023-11-16

בדיקת ביצועים של מודלי שפה על מענה לשאלות פיננסיות מתוך מסמכים גלויים. המאגר מציע מדגם מתויג שנועד להציב רף מינימלי למערכות שאמורות לקרוא דוחות כספיים בלי להמציא עובדות.

  • 5,109הורדות בחודש
  • 139לייקים

מה זה

המאגר כולל מדגם פתוח של 150 דוגמאות מתויגות מתוך המחקר של החברה. כל רשומה מורכבת משאלה על חברות ציבוריות, תשובה נכונה, ומחרוזות טקסט שמשמשות כראיות ישירות מתוך המקורות.

השאלות נבנו כדי לייצג תרחישים אמיתיים ומגוונים מהשטח, מתוך כוונה שיהיו ברורות וחד משמעיות למענה. הן נועדו להוות רף ביצועים בסיסי למודלים. מסמכי המקור הם קובצי PDF של דוחות כספיים, והם זמינים בקישור חיצוני ייעודי בגיטהאב של הפרויקט לצורך הרצת שאילתות מול ספריית המסמכים המלאה.

החוקרים השתמשו בנתונים האלה כדי להעריך 16 תצורות של מודלים מובילים, כולל מודלים קנייניים ומודלים פתוחים, תוך שילוב מאגרי וקטורים והקשרים ארוכים. התוצאות נבדקו ידנית על פני 2,400 תשובות, והראו כישלונות חוזרים בהזיות וחוסר דיוק שמונעים שימוש ארגוני אמין.

מתאים ל

  • בנצ'מרק למערכות RAG

    בדיקת יכולת המערכת לשלוף ראיות מדויקות מתוך דוחות PDF ולענות נכון.

  • מדידת הזיות במודלים

    השוואת תשובות המודל מול תשובות האמת כדי לזהות המצאת עובדות פיננסיות.

  • השוואת ארכיטקטורות

    בחינה של חלונות הקשר ארוכים מול חיפוש וקטורי על נתונים מוגדרים מראש.

איפה זה נופל

הגרסה החופשית מכילה 150 דוגמאות בלבד מתוך הדאטהסט המלא, כך שמדובר במדגם בדיקה צר ולא במאגר אימון. הנתונים מתמקדים אך ורק בחברות ציבוריות ובשפה האנגלית, ללא כיסוי לשפות אחרות או לדיווחים מקומיים. מעבר לכך, השאלות הוגדרו כפשוטות וחד משמעיות במכוון. אם המערכת שלכם צריכה להתמודד עם ניתוחים פיננסיים מורכבים יותר או מסמכים שאינם דוחות של חברות ציבוריות, הבדיקה כאן לא תספיק כדי להוכיח יציבות.

שאלות
נפוצות

האם מותר להשתמש במאגר במוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0 שמגביל את השימוש למטרות שאינן מסחריות בלבד. לצורך שימוש מסחרי או גישה לדאטהסט המלא יש לפנות ישירות ליוצרים.

האם הדאטהסט כולל תמיכה בעברית?

לא, הנתונים מבוססים על דוחות כספיים של חברות ציבוריות באנגלית בלבד. אין במאגר טקסטים או שאלות בעברית, ואין התייחסות לדיווחים לפי התקינה הישראלית.

כמה מקום המאגר תופס והאם הוא כבד להורדה?

המאגר קל מאוד וכולל שלושה קבצים בלבד, כשהמרכזי שבהם הוא קובץ jsonl עם 150 רשומות. הורדת הנתונים אורכת שניות ספורות, אך קובצי ה־PDF המקוריים יושבים בגיטהאב נפרד.

מאיפה הגיעו הנתונים ואיך הם נאספו?

הנתונים נאספו על ידי PatronusAI מתוך מסמכים גלויים של חברות ציבוריות. החוקרים ניסחו שאלות ברורות ומדויקות, הצמידו להן תשובות נכונות וקטעי ראיות מתוך המקורות, ובדקו ידנית את ביצועי המודלים.

איך טוענים

טוענים את הקובץ financebench_merged.jsonl ישירות מהמאגר, בלי צורך בבקשת גישה מיוחדת או אישור מקדים. המאגר מכיל שלושה קבצים בלבד, כך שההורדה מהירה מאוד. השדות המרכזיים לעבודה הם השאלה, התשובה התקנית, והראיות הטקסטואליות שתומכות בה. כדי לבצע הערכה מלאה בסגנון ספר פתוח תצטרכו להוריד בנפרד את קובצי ה־PDF מהמאגר המקושר בגיטהאב, לחלץ מהם טקסט או וקטורים, ולהריץ מולם את השאלות.

from datasets import load_dataset

ds = load_dataset("PatronusAI/financebench")

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות היא שהשימוש מותר למטרות מחקר, לימוד ובדיקות פנימיות בלבד, תוך מתן קרדיט ליוצרים. אסור להשתמש במאגר לצרכים מסחריים, ואסור למכור שירות או מוצר שמבוססים עליו. אם תאמנו מודל ישירות על הנתונים האלה, לא תוכלו לפרוס אותו לשימוש מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗