GPT
F

financial-reports-sec

קוד פתוח

JanosAudranapache-2.02023-01-02

  • 'finance
  • financial
  • 10-K
  • 10K
  • 10k

מאגר ענק של משפטים מתוך דוחות שנתיים אמריקאיים עם תיוג סנטימנט לפי תגובת השוק בפועל. מתאים למי שרוצה לאמן מודל שפה פיננסי או לחזות תשואות מתוך טקסט רגולטורי.

  • 7,551הורדות בחודש
  • 77לייקים

מה זה

הנתונים מבוססים על דוחות 10-K של חברות ציבוריות בארצות הברית שהוגשו למערכת SEC EDGAR בין השנים 1993 ל־2020. כל דוח שנתי פורק לעשרים מקטעים רשמיים, וכל מקטע חולק למשפטים בודדים ששומרים על הסדר המקורי שלהם. כל רשומה במאגר מייצגת משפט יחיד, וכוללת תיוג סנטימנט ברמת הדוח כולו לפי תנועת המניה סביב יום ההגשה בחלונות של יום, חמישה ימים ושלושים יום.

העיבוד התבסס על מחקר EDGAR-CORPUS, בשילוב נתוני מחירים ומניות מ־Yahoo Finance ומטא-דאטה שנאסף ישירות מה־SEC. החוקרים ניקו רשומות כפולות או לא ברורות, והגדירו חלונות זמן מדויקים סביב תאריך פרסום הדוח כדי לחשב את התשואות.

המאגר מגיע בארבע תצורות. גרסאות large_full ו־large_lite מכילות מעל 71 מיליון משפטים, כשההבדל ביניהן הוא כמות שדות המטא-דאטה. גרסאות small_full ו־small_lite מציעות מדגם מוקטן של 240,000 משפטים בסך הכל שמתחלקים לאימון, בדיקה ואימות לצורך בדיקות מהירות.

מתאים ל

  • אימון מודלי שפה פיננסיים

    התאמת מודלים כמו BERT לטרמינולוגיה פיננסית באמצעות משימות fill-mask על מיליוני משפטים רגולטוריים.

  • חיזוי תגובת שוק לדוחות

    אימון מסווגים לזיהוי סנטימנט של דוחות 10-K מול תנועות מחיר של המניה בחלונות זמן שונים.

  • סיווג מקטעים רגולטוריים

    זיהוי ומיון של פסקאות ומשפטים לפי 20 הסעיפים הרשמיים המוגדרים בדיווחי SEC.

איפה זה נופל

הטקסט כולו באנגלית ותחום אך ורק לחברות ציבוריות בארצות הברית, בלי שום ייצוג לעברית או לשווקים אחרים. בנוסף, המידע נחתך בשנת 2020, כך שהוא לא מכסה דוחות מהשנים האחרונות. תיוג הסנטימנט ניתן ברמת הדוח השלם ולא ברמת המשפט הספציפי, ולכן משפט בודד עשוי לקבל תגית חיובית או שלילית רק בגלל תנועת המניה הכללית. בנוסף, חלונות הזמן של התשואות מושפעים מרעשי שוק חיצוניים ולא רק מתוכן הדוח.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון apache-2.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים והפצת תוצרים, כל עוד מקפידים על מתן קרדיט וצירוף עותק מהרישיון המקורי.

האם יש במאגר נתונים בעברית או על חברות ישראליות?

לא. כל הטקסטים הם באנגלית ומגיעים אך ורק מדיווחים שהוגשו ל־SEC האמריקאי, אם כי חברות ישראליות שנסחרו בארצות הברית ומילאו טופס 10-K עשויות להופיע שם.

איך נקבע אם משפט הוא חיובי או שלילי?

התיוג לא נעשה ידנית ולא נבדק ברמת המשפט. התווית נקבעה לפי תשואת המניה סביב יום הגשת הדוח לחלונות של יום, חמישה ימים ושלושים יום, ומשויכת לכל המשפטים באותו דוח.

מה ההבדל בין גרסאות ה־full ל־lite?

גרסאות ה־lite כוללות רק את הטקסט, זיהוי המקטע, מזהה המשפט והתיוגים. גרסאות ה־full מוסיפות מטא-דאטה מקיף על החברה כמו סימול מניה, בורסה שבה היא נסחרת, ענף ותאריכי קבלה מדויקים.

איך טוענים

טוענים את המאגר ישירות בספריית datasets דרך השם JanosAudran/financial-reports-sec עם ציון הקונפיגורציה הרצויה. אין צורך בבקשת גישה מיוחדת או אישור מקדים. הקבצים שמורים בפורמט jsonl שמחולק למקטעים, ויש לקחת בחשבון שגרסאות ה־large מכילות עשרות מיליוני שורות וידרשו משאבי זיכרון ואחסון משמעותיים. השדות החשובים לעבודה הם sentence שמכיל את הטקסט, section שמזהה את חלק הדוח, ו־labels שמחזיק את התיוג לסנטימנט חיובי או שלילי לפי חלונות הזמן.

from datasets import load_dataset

ds = load_dataset("JanosAudran/financial-reports-sec")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, מחקרי ופרטי, ומתיר שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובה לשתף את הפיתוחים שלכם תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗