GPT
F

Fino1_Reasoning_Path_FinQA

קוד פתוח

TheFinAIcc-by-4.02025-02-12

  • finance

שאלות ותשובות מתוך FinQA שקיבלו שרשראות חשיבה מפורטות בעזרת GPT-4o. המאגר נבנה כדי לאמן מודלים על פירוק של בעיות חישוב פיננסיות מורכבות ולא רק על פליטת התוצאה הסופית.

  • 2,881הורדות בחודש
  • 41לייקים

מה זה

המאגר הזה לוקח את השאלות והתשובות מתוך FinQA, שהוא דאטהסט ותיק של שאלות חישוביות על דוחות פיננסיים, ומוסיף להן שלב מקדים. במקום להסתפק בצמד פשוט של שאלה ומספר סופי, היוצרים הריצו פרומפט מול GPT-4o וביקשו ממנו לתעד את כל שלבי ההסקה בדרך לפתרון.

הרשומות מכילות את שאלת המקור, את התשובה ואת נתיב החשיבה המובנה שנוצר על ידי המודל. המטרה כאן היא לתת למודלים אחרים ללמוד איך מנתחים נתון כספי צעד אחר צעד, מתוך הנחה שחיקוי התהליך ישפר את הדיוק המספרי. אין בכרטיס פירוט לגבי סינון ידני או בדיקת איכות אנושית של התוצרים שהתקבלו מ־GPT-4o, והחלוקה היחידה שמופיעה בקבצים היא קובץ אימון בודד.

מתאים ל

  • אימון SFT למודלי שפה

    לימוד מודלים פתוחים כיצד לפרק שאלות חישוביות מורכבות על דוחות כספיים לצעדים קטנים.

  • הערכת יכולות הסקה

    בדיקה אם מודל קיים מצליח לשחזר שלבי חשיבה פיננסיים נכונים עד קבלת התוצאה.

  • יצירת דוגמאות לפרומפטים

    חילוץ דוגמאות של Few-shot לשימוש במערכות שרשרת חשיבה מול מודלים קיימים.

איפה זה נופל

כל נתיבי החשיבה נוצרו בצורה סינתטית לחלוטין על ידי GPT-4o. הכרטיס לא מדווח על בדיקה אנושית שאימתה את החישובים, כך שטעויות חשבוניות או הזיות של המודל המייצר עלולות לעבור ישירות אל המודל שתאמנו. המידע קיים כולו באנגלית בלבד, ומתבסס על שאלות שנלקחו מדוחות ישנים מתוך FinQA. אם אתם בונים על ניתוח דוחות בעברית או תקינה מקומית, הדאטה הזה לא רלוונטי לכם בלי עבודת תרגום והתאמה מאסיבית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא. הדרישה היחידה היא לתת ייחוס מתאים לחוקרים שפרסמו אותו ולמאגר FinQA המקורי.

האם יש במאגר שאלות או מסמכים בעברית?

לא. הדאטהסט מוגדר באנגלית בלבד, והוא עוסק בדוחות פיננסיים ובשאלות שנכתבו באנגלית. שימוש בעברית ידרוש תרגום והתאמה של המונחים.

איך נוצרו נתיבי החשיבה שמצורפים לשאלות?

היוצרים לקחו את צמדי השאלות והתשובות מ־FinQA והריצו עליהם פרומפט ייעודי מול GPT-4o. המודל ייצר את שלבי ההסקה המפורטים עבור כל תשובה באופן אוטומטי.

מה ההבדל בינו לבין FinQA המקורי?

בעוד FinQA המקורי התמקד בעיקר במתן התשובה המספרית לשאלה, כאן נוסף שלב הביניים הסינתטי. המטרה היא לאמן מודלים להסביר את החישוב ולא רק לנחש את המספר.

איך טוענים

טוענים את המאגר ישירות מקובץ data/train.parquet שנמצא במאגר Hugging Face, או בעזרת ספריית datasets של פייתון דרך המזהה TheFinAI/Fino1_Reasoning_Path_FinQA. אין פה צורך באישור גישה מיוחד או בהרשמה מוקדמת, והורדת הקבצים פתוחה לחלוטין לכולם.

המאגר קומפקטי וכולל שלושה קבצים בלבד, כך שלא תצטרכו שטח אחסון חריג או הכנה מוקדמת של תשתיות כבדות. השדות שמעניינים אתכם בפנים הם השאלה המקורית, התשובה ונתיב ההסקה הסינתטי שנבנה עבורה, ומשם אפשר להזין אותם ישירות לתוך תהליך Supervised fine-tuning של מודל פתוח.

from datasets import load_dataset

ds = load_dataset("TheFinAI/Fino1_Reasoning_Path_FinQA")

הרישיון

הרישיון המדווח הוא cc-by-4.0. המשמעות היא שמותר להשתמש בנתונים למטרות מחקר וגם למטרות מסחריות, כולל אימון של מודלים סגורים, כל עוד אתם נותנים קרדיט ומצטטים את יוצרי המאגר ואת FinQA המקורי. אין כאן חובת שיתוף של הנגזרות באותו הרישיון, מה שמשאיר את תוצרי האימון בידיים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗