GPT
E

edgar-corpus

קוד פתוח

eloukasapache-2.02022-12-30

  • research papers
  • edgar
  • sec
  • finance
  • financial

מאגר ענק של דוחות שנתיים מחברות ציבוריות בארה״ב, מחולק לפי סעיפים רשמיים. הוא שימושי למי שמאמן מודלים על טקסטים פיננסיים ארוכים ומורכבים במקום להתמודד עם קבצי מקור גולמיים.

  • 6,732הורדות בחודש
  • 63לייקים

מה זה

כל רשומה במאגר מייצגת דוח שנתי מסוג 10-K שהוגש לרשות ניירות הערך האמריקאית, ה־SEC. במקום מסמך ארוך אחד, הטקסט מפורק לכל הסעיפים הסטנדרטיים של ההגשה, כולל סעיפי הליבה כמו תיאור העסק, גורמי סיכון, ודיוני הנהלה על המצב הכספי.

לצד תוכן הסעיפים, כל שורה מכילה מזהים בסיסיים כמו שם הקובץ, שנת הדיווח ומספר ה־CIK הייחודי של החברה המדווחת. המאגר מאורגן בתצורות שונות שמאפשרות למשוך את כל הנתונים כמקשה אחת, או לגשת לחלוקות שנתיות ספציפיות שמתחילות מ־1993, כאשר כל שנה מפוצלת מראש לסטים של אימון, תיקוף ובדיקה.

מתאים ל

  • אימון מודלים להערכת סיכונים

    ניתוח סעיף גורמי הסיכון בדוחות כדי לזהות איומים תפעוליים ומשפטיים על חברות.

  • סיכום אוטומטי של דוחות כספיים

    יצירת תקצירים ממוקדים לסעיפי הדיון והניתוח של ההנהלה מתוך מסמכים ארוכים.

  • סיווג שינויים עסקיים לאורך זמן

    השוואת סעיף תיאור העסק באותה חברה לאורך שנים שונות כדי לעקוב אחר תמורות בפעילות.

איפה זה נופל

כל הטקסט במאגר כתוב באנגלית בלבד ומתרכז בשוק ההון האמריקאי, כך שאין כאן מידע מקומי או כיסוי לחברות שלא מדווחות בפורמט האמריקאי. בנוסף, חלוקת הסעיפים ההיסטורית אינה אחידה. סעיפים שנכנסו לרגולציה בשנים מאוחרות יותר, למשל סעיף גורמי הסיכון שהפך לחובה רק באמצע שנות האלפיים, עשויים להיות ריקים לחלוטין בדוחות ישנים משנות התשעים. צריך לבדוק היטב את תקינות הפילוח של הסעיפים לפני שמשתמשים בהם, כי חילוץ אוטומטי ממסמכי מקור נוטה לכלול שגיאות פירסור וטקסט קטוע.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוגדר הוא Apache 2.0 שאינו מגביל שימוש מסחרי. אתם יכולים לאמן עליו מודלים ולשלב אותם במוצרים סגורים. יש רק לוודא ששומרים על הודעת הקרדיט והתנאים המקוריים של הרישיון בהפצה.

כמה שטח אחסון צריך כדי לעבוד איתו?

הגרסה המלאה דורשת לפחות 40 ג'יגהבייט להורדה ועוד נפח דומה לאחר פריסה בזיכרון. אם אין לכם משאבים כאלה, אפשר למשוך רק שנים בודדות. חלוקה שנתית ממוצעת נעה בין כמה מאות מגהבייט לג'יגהבייט וחצי בלבד.

האם יש במאגר דוחות של חברות ישראליות או טקסט בעברית?

אין במאגר טקסט בעברית בכלל, כל הנתונים באנגלית. חברות ישראליות יכולות להופיע בו רק אם הן נסחרות בארה״ב ומגישות דוחות מסוג 10-K לרשות ניירות הערך. חברות זרות שמגישות טפסים אחרים אינן נכללות כאן.

איך המידע הזה נאסף והאם הוא מעודכן?

הטקסטים נמשכו ישירות ממערכת הדיווחים האלקטרונית EDGAR של ה־SEC ופורסמו במאגר בסוף 2022. הקבצים מכילים היסטוריה החל משנת 1993, אך הם מייצגים תמונת מצב סטטית שנאספה עד מועד הפרסום. מי שצריך נתונים מהשנים האחרונות ייאלץ לחלץ אותם בעצמו.

איך טוענים

טוענים את המאגר ישירות מקוד פייתון דרך הספרייה של Hugging Face, ואין צורך לבקש אישור גישה מיוחד. ההורדה המלאה כבדה מאוד ומגיעה לכ־40 ג׳יגהבייט דחוסים ויותר מ־40 ג׳יגהבייט לאחר פריסה, כך שלא מומלץ להוריד את התצורה המלאה בלי שטח אחסון מתאים. אם רוצים לבדוק את הנתונים במהירות, עדיף להגדיר תצורה של שנה בודדת, כמו שנת 1993 ששוקלת סביב 140 מגהבייט. השדות המרכזיים לעבודה הם שנת ההגשה, מזהה החברה והסעיפים הטקסטואליים שמעניינים את המשימה שלכם.

from datasets import load_dataset

ds = load_dataset("eloukas/edgar-corpus")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים והפצה מחודשת שלהם. מותר לאמן עליו מודלים מסחריים בלי לחשוף את קוד המקור, ואין חובה לשתף תוצרים תחת אותו הרישיון. הדרישה העיקרית היא הכללת עותק של הרישיון והודעת זכויות היוצרים המקורית בתוצרי ההפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗