GPT
S

SEC-EDGAR

קוד פתוח

TeraflopAIapache-2.02025-11-13

  • finance
  • edgar
  • sec

מאגר ענק של דיווחי רשות ניירות ערך האמריקאית שחוסך שבועות של זחילה וניקוי. הוא מביא טקסט גולמי ומעובד ממיליוני טפסים פיננסיים, מוכן לאימון מודלים או למערכות אחזור מידע.

  • 14,162הורדות בחודש
  • 46לייקים

מה זה

המאגר כולל מעל 8 מיליון דיווחים רשמיים שהורדו ממאגר הדיווחים של רשות ניירות הערך בארצות הברית, ומכיל כ־43 מיליארד טוקנים בנפח של 590 גיגה בייט. החומר נאסף באמצעות ספריית datamule ועבר חילוץ מקבצי SGML, HTML ו־XML באמצעות הכלים selectolax ו־doc2dict, תוך טיפול במבנה של טבלאות.

כל רשומה מגיעה עם התוכן הגולמי של המסמך, הטקסט הנקי שחולץ ממנו, ומטא דאטה מפורט. המידע הנלווה כולל את פרטי החברה המדווחת כמו שם, מספר מזהה, סיווג ענפי, כתובת ומספר תיק, לצד נתוני הדיווח עצמו שכוללים תאריכים וסוג הטופס.

החלוקה הפנימית מציגה הבדל עצום בין כמות המסמכים לכמות הטקסט בפועל. טופס 4 מהווה יותר ממחצית מהרשומות עם כ־4.47 מיליון דוחות קצרים, אך מרבית הטוקנים, מעל 32 מיליארד יחד, מגיעים דווקא מדוחות תקופתיים מקיפים כמו 10-K השנתי ו־10-Q הרבעוני.

מתאים ל

  • אימון מודלים לתחום הפיננסי

    לימוד מקדים או התאמה של מודלי שפה על 43 מיליארד טוקנים של ניתוחים כלכליים, דוחות כספיים וטקסט רגולטורי.

  • מערכות חיפוש ואחזור מידע

    בניית מאגר וקטורי לאחזור עובדות על חברות ציבוריות מתוך דוחות רשמיים, באמצעות הטקסט הנקי והמטא דאטה.

  • סיווג מסמכים וזיהוי ישויות

    אימון מסווגים לחלוקת פסקאות לפי נושאים פיננסיים, או חילוץ פרטי תאגידים על בסיס מזהי החברות והטפסים השונים.

איפה זה נופל

הטקסט כולו באנגלית בלבד ועוסק ברגולציה פיננסית אמריקאית, כך שאין כאן שום מידע על חברות ישראליות שלא נסחרות בארצות הברית. כמות הדוגמאות מוטה מאוד לטובת דיווחים קצרים של בעלי עניין, מה שמחייב סינון לפי סוג טופס לפני אימון כדי לא להציף את המודל בתבניות חוזרות. בנוסף, חילוץ טקסט מטבלאות ומסמכי XML מורכבים תמיד כולל שיבושים, ולכן אם הדיוק במבנה הנתונים קריטי למוצר שלכם, תצטרכו לחזור לטקסט הגולמי שמצורף ולבנות חילוץ משלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המאגר מפורסם תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי מלא, כולל אימון מודלים שיימכרו בתשלום. הדרישה היחידה היא מתן קרדיט וצירוף עותק של הרישיון.

כמה מקום צריך לפנות בדיסק כדי להוריד את הכל?

הקבצים שוקלים 590 גיגה בייט במצטבר. בגלל שהם מסודרים ב־2,556 קבצי Parquet לפי סוגי טפסים, אפשר להוריד רק את החלקים הנחוצים, כמו דוחות שנתיים בלבד.

האם יש במאגר נתונים בעברית?

לא. כל 8 מיליון המסמכים מקורם ברשות ניירות הערך האמריקאית, ושפת המקור של כולם היא אנגלית.

במה המאגר הזה שונה מהורדה ישירה מרשות ניירות הערך?

הרשות מגבילה את קצב ההורדה לעשר בקשות בשנייה, כך שאיסוף עצמאי לוקח שבועות של זחילה. כאן קיבלתם את הקבצים מוכנים, כולל פירוק של קובצי ה־SGML והמרת הטבלאות וה־HTML לטקסט קריא.

איך טוענים

החומר מחולק ל־2,556 קבצי Parquet לפי סוגי הדיווח, וטוענים אותו ישירות דרך הספרייה הרגילה של Hugging Face ללא צורך באישור גישה מיוחד. בגלל המשקל הכולל של 590 גיגה בייט, כדאי להזרים את המידע או להוריד רק את התיקיות של הטפסים שרלוונטיים למשימה שלכם. השדות החשובים לטקסט הם התוכן הגולמי והטקסט הנקי שחולץ, לצד מזהה החברה ותאריך הדיווח לצורך סינון.

from datasets import load_dataset

ds = load_dataset("TeraflopAI/SEC-EDGAR")

הרישיון

המאגר מופץ ברישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הנתונים והפצה שלהם, כולל אימון מודלים מסחריים סגורים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי, בלי חובה לשתף את הקוד או את המודל שתאמנו באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗