GPT
F

FNSPID

קוד פתוח

Zihan1004רישיון לא דווח2024-02-19

מעל עשרה מיליון רשומות של חדשות פיננסיות שמסודרות על ציר זמן. הוא מתאים למי שרוצה לבדוק קשר בין דיווחים עיתונאיים לתנועות שוק בלי לאסוף מידע לבד.

  • 6,487הורדות בחודש
  • 121לייקים

מה זה

המאגר כולל מעל עשרה מיליון כתבות וקטעי חדשות מעולם הכלכלה, שסודרו במבנה של סדרות עיתיות. המטרה כאן היא לאפשר למידה של מגמות פיננסיות וסנטימנט משקיעים ביחס לתנודות בשוק. הטקסטים כולם באנגלית, והם מוצמדים לנקודות זמן כדי שתוכלו להריץ תחזיות ישירות מול נתוני מסחר.

מבנה הקבצים מורכב מכמה חלקים עיקריים שיושבים בתיקיות ייעודיות. יש כאן נתוני חדשות מקובצים בפורמט CSV, כולל קובץ חיצוני כללי וקובץ נפרד שמיועד למידע על מניות נאסד״ק. לצידם תמצאו תיקייה של מחירי מניות עם קובץ דחוס שמחזיק היסטוריה מלאה, מה שחוסך את הצורך לחפש נתוני מסחר תואמים ממקור אחר.

היוצרים לא פירטו בכרטיס את שיטות הסינון המדויקות, את רשימת אתרי החדשות שמתוכם הם שלפו את החומרים או את טווח התאריכים המלא. במקום זה הם מפנים למאמר ולפרויקט גיטהאב ייעודי, כך שצריך לחפור בקוד כדי להבין איזה ניקוי בוצע בפועל לפני שהנתונים נארזו.

מתאים ל

  • חיזוי תנודות שוק

    אימון מודלים שמנסים לחזות שינויים במחירי מניות על בסיס רצף של דיווחים חדשותיים.

  • ניתוח סנטימנט פיננסי

    בדיקת האופן שבו ניסוחים של כתבות כלכליות משקפים או מקדימים את תחושות המשקיעים.

  • אימון מודלי שפה ייעודיים

    התאמת מודלי טקסט לתחום הפיננסי בעזרת מאגר גדול של כתבות באנגלית.

איפה זה נופל

הנתונים כולם באנגלית, בלי שום כיסוי לשפות אחרות או לבורסה המקומית בישראל. הבעיה המרכזית היא חוסר השקיפות בכרטיס עצמו. המפרסמים לא מציינים באילו שנים הכתבות פורסמו, מאילו עיתונים או אתרים הן נלקחו, ואיזה סינון הופעל עליהן. בנוסף, מודלים פיננסיים רגישים להטיות שורדים ושינויי מאקרו, ולכן לא הייתי מכניס את הנתונים האלה למערכת מסחר אמיתית לפני שבודקים את טווח התאריכים ומאמתים את איכות הטקסט מול נתוני אמת.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

לא. הכרטיס מציין רישיון שמגביל את השימוש למטרות לא מסחריות בלבד, ומדגיש איסור מסחרי מפורש. אם אתם רוצים להשתמש בזה למוצר, צריך לפנות למייל של היוצרים ולבקש אישור מיוחד.

האם יש במאגר תוכן בעברית?

אין עברית כלל. כל הטקסטים והרשומות בדאטהסט מוגדרים באנגלית בלבד ומתרכזים בשווקים בינלאומיים, בעיקר סביב נתוני נאסד״ק.

מאיפה נאספו הכתבות ומה טווח השנים?

הכרטיס עצמו לא מפרט את רשימת המקורות, אתרי החדשות או התאריכים המדויקים. המידע הזה נמצא כנראה במאמר האקדמי ובקוד שבגיטהאב, ולכן כדאי לקרוא אותם לפני שמסתמכים על המאגר במחקר.

איך המידע מסודר בפועל?

הנתונים מחולקים לקובצי טקסט שמכילים חדשות כלליות וחדשות על נאסד״ק, לצד קובץ ארכיון שמכיל את היסטוריית מחירי המניות. המבנה נועד לאפשר חיבור ישיר בין זמני הדיווחים לשינויי המחירים.

איך טוענים

אין צורך לבקש אישור גישה מראש. מורידים את הקבצים ישירות דרך המאגר, אבל צריך לקחת בחשבון שמדובר בהיקף של מעל עשרה מיליון רשומות, כך שהקובץ הדחוס והטבלאות ידרשו זיכרון עבודה משמעותי ועיבוד מקדים. הנתונים מגיעים בקובצי CSV ובארכיון זיפ שמכיל את היסטוריית המחירים. תצטרכו לפתוח את הארכיון, לטעון את קובצי הטקסט, ולבצע התאמה בין חותמות הזמן של החדשות לבין מחירי המניות כדי להתחיל לעבוד.

from datasets import load_dataset

ds = load_dataset("Zihan1004/FNSPID")

הרישיון

הכרטיס מגדיר רישיון קריאייטיב קומונס מסוג ייחוס, לא מסחרי 4.0. זה אומר שמותר להשתמש במידע למחקר, להערכה ולניסויים אישיים, אבל אסור בהחלט להשתמש בו לצרכים מסחריים בלי לקבל אישור מפורש מראש מהיוצרים. מודל שאומן על המאגר הזה לא יכול להיכנס ישירות למוצר מסחרי בלי להסתכן בהפרת הרישיון, ויש לפנות למייל של המחברים אם רוצים היתר כזה.

הרישיון המלא ב־Hugging Face ↗