GPT
T

t2-ragbench

קוד פתוח

G4KMUcc-by-4.02025-05-14

  • pdf
  • finance
  • rag

בנצ'מרק פיננסי שנועד לבדוק מערכות RAG על שילוב של טבלאות וטקסט. הוא מתאים למי שרוצה לבחון שליפה וחישוב נומרי על דוחות חברות אמיתיים ולא רק על טקסט פשוט.

  • 5,943הורדות בחודש
  • 17לייקים

מה זה

המאגר מאחד שלוש חבילות נתונים פיננסיות קיימות: FinQA, ConvFinQA ו־TAT-DQA. הוא מכיל מעל שבעת אלפים מסמכים ועשרות אלפי שאלות ותשובות, לצד קובצי המקור המקוריים בפורמט PDF מדוחות כספיים שהוגשו לרשות ניירות הערך האמריקאית. כל רשומה כוללת מזהה ייחודי, שאלת מחקר, תשובה מקורית, תשובה מספרית מאומתת להערכה, והקשר המשלב טקסט וטבלאות.

הייחוד בעבודה הזו הוא שכתוב השאלות. במקורות המקוריים השאלות הסתמכו לרוב על הקשר נתון, וכאן הן שוכתבו כדי שיהיו עצמאיות לחלוטין. בחלקים המבוססים על FinQA ו־ConvFinQA הנתונים מועשרים גם בטבלאות בפורמט Markdown, טקסט שלפני ואחרי הטבלה, ומטא-דאטה מקיף על החברות כמו סימול מניה, מגזר, תעשייה, שנת דוח ומספר CIK. תת-המאגר VQAonBD הוסר מהגרסה הנוכחית בגלל איכות נמוכה של שכתוב השאלות.

מתאים ל

  • הערכת RAG פיננסי

    בדיקת יכולת השליפה והמענה של מנועי RAG על דוחות כספיים המשלבים טקסט וטבלאות.

  • מענה על שאלות מטבלאות

    אימון ומדידה של מודלים לחילוץ וחישוב נתונים נומריים מתוך טבלאות Markdown ו־PDF.

  • עיבוד ישיר של PDF

    פיתוח צנרות OCR ועיבוד מסמכים מורכבים ישירות מתוך אלפי קובצי המקור של דוחות SEC.

איפה זה נופל

השאלות שוכתבו באמצעות מודל השפה LLaMA 3.3-70B ולא נכתבו במקור על ידי בני אדם, ורק חלק אקראי מהן נבדק ידנית. לפי החוקרים שכתוב השאלות הגיע לרמת עצמאות של מעל 80 אחוזים, מה שאומר שחלק קטן מהשאלות עדיין עלול להכיל תלות בהקשר חיצוני. כל הנתונים מגיעים מדוחות כספיים של חברות ציבוריות באנגלית בלבד, כך שאין כאן מילה בעברית, והמבנה מתאים בעיקר לעולם הפיננסי ולא יעיד על ביצועים בסוגי מסמכים אחרים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא cc-by-4.0, שמתיר שימוש מסחרי מלא, כולל אימון והערכה של מערכות סגורות. התנאי היחיד הוא מתן קרדיט ליוצרי המאגר לפי הנחיות הרישיון.

האם יש בדאטהסט נתונים בעברית?

לא, המאגר כולו באנגלית. הוא מבוסס על דוחות כספיים של חברות ציבוריות בארצות הברית שהוגשו ל־SEC, ולא כולל שום תוכן מקומי או ישראלי.

איך נאספו ונוצרו השאלות במאגר?

הבסיס מורכב משלושה מאגרים קיימים: FinQA, ConvFinQA ו־TAT-DQA. השאלות המקוריות נשענו על הנחה שהמסמך כבר מוצג למודל, ולכן החוקרים העבירו אותן שכתוב באמצעות מודל LLaMA 3.3-70B כדי להפוך אותן לשאלות עצמאיות שמתאימות לשליפה.

מה ההבדל בין המאגר הזה למאגרי QA פיננסיים קודמים?

במאגרים רגילים המודל מקבל מראש את הפסקה והטבלה הרלוונטיות, כך שנבדק רק ההיגיון החישובי. כאן השאלות נוסחו מחדש כדי לאפשר בדיקה של שלב השליפה בתוך אלפי מסמכים שלמים וקובצי PDF.

איך טוענים

המאגר פתוח לחלוטין ואינו דורש אישור גישה מראש. הוא מכיל 13,187 קבצים שכוללים אלפי דפי PDF מקוריים, כך שהורדה מלאה של המאגר באמצעות Git דורשת מקום בדיסק וזמן הורדה. הרשומות מחולקות לסטים של אימון, פיתוח ומבחן. בעבודה מול הנתונים חשוב לשים לב לשדות question ו־context עבור שליפה, לשדה program_answer לצורך חישוב מדדי דיוק נומריים, ולשדה table שמביא את המבנה הטבלאי המדויק.

from datasets import load_dataset

ds = load_dataset("G4KMU/t2-ragbench")

הרישיון

המאגר מופץ ברישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, כולל אימון מודלים פנימיים או מוצריים, בתנאי אחד פשוט: מתן קרדיט מתאים ליוצרים המקוריים וקישור לרישיון. אין חובה לשתף את המודל או את הנגזרות באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗