GPT
S

Stocks-Daily-Price

קוד פתוח

paperswithbacktestother2024-05-29

  • finance
  • quantitative-trading
  • backtesting
  • algorithmic-trading
  • stocks

נתוני מסחר יומיים של מניות מציעים היסטוריה ארוכה למחקר אותות אלגוריתמיים. המאגר מרכז עשרות מיליוני שורות מתואמות פעולות חברה עבור אלפי טיקרים שונים.

  • 7,709הורדות בחודש
  • 60לייקים

מה זה

המאגר כולל 25,986,919 שורות של נתוני מחיר יומיים שמכסים 7,764 מניות. הנתונים מתחילים ב־2 בינואר 1962 ונמשכים קדימה על פני עשרות שנות מסחר, עם עדכון חודשי של הקבצים. כל רשומה כוללת שמונה עמודות סטנדרטיות: סימול המניה, תאריך המסחר, מחזורי מסחר, מחירי פתיחה, סגירה, גבוה, נמוך, ומחיר סגירה מתואם.

המידע נשמר בארבעה קובצי Parquet שונים תחת ספריית האימון, לצד קובץ התיעוד. המחירים המתואמים משקללים פיצולי מניות וחלוקת דיבידנדים, ומאפשרים לבחון תשואה כוללת. הנתונים עצמם מגיעים מהזנות של ספקי מידע פיננסי שמשרתים בעיקר מניות שנסחרות כיום בשוק.

מתאים ל

  • בדיקת אסטרטגיות מומנטום

    הרצת סימולציות היסטוריות על נתוני מחירים יומיים כדי לבחון אותות חזרה לממוצע על פני עשרות שנים.

  • אופטימיזציית תיקי השקעות

    חישוב מטריצות שונות ומזעור שונות בתיקים מרובי מניות לאורך תקופות מסחר ארוכות.

  • אימון מודלי חיזוי מחיר

    בניית מודלי רגרסיה וסדרות עתיות לחיזוי מגמות על בסיס נתוני נפח מסחר ומחירים מתואמים.

איפה זה נופל

הבעיה המרכזית כאן היא הטיית שרידות מובהקת שהיוצרים מודים בה בגלוי. רק 3.5% מהסימולים שייכים לחברות שנמחקו מהמסחר, בזמן שבמציאות ההיסטורית של הבורסות בארצות הברית כ־44% מהמניות כבר לא קיימות. ספקי הנתונים שלפו בעיקר חברות שעדיין פעילות, ולכן כל בדיקה היסטורית שתריצו על המאגר תציג ביצועים טובים מדי ביחס למציאות. בנוסף, הנתונים מוגבלים לשפה האנגלית ולשוקי מניות ספציפיים, ללא שום נתונים מקומיים על מניות ישראליות.

שאלות
נפוצות

האם הנתונים כוללים מניות ישראליות?

המאגר מציג נתונים באנגלית שמתרכזים בעיקר בחברות שנסחרות בארצות הברית לפי הסימולים המקובלים שם. אין בו התייחסות למניות הנסחרות בבורסה בתל אביב, ולא תמצאו בו נתונים פיננסיים בשקלים.

האם אפשר להשתמש במידע הזה בחינם?

לא, הגישה לקבצים עצמם חסומה להורדה חופשית. אפשר לראות את המבנה של הטבלאות ואת התיעוד בהאגינג פייס, אבל כדי להוריד את קובצי הנתונים נדרש מנוי בתשלום לפי התוכניות באתר היוצרים.

מה הבעיה עם בדיקות היסטוריות על המאגר?

המאגר סובל מהטיית שרידות כבדה בגלל שספקי המידע סיפקו בעיקר חברות שעדיין נסחרות כיום. מודל שירוץ על הנתונים האלה יראה תוצאות משופרות באופן מלאכותי, כי הוא מתעלם מרוב החברות שפשטו רגל ונמחקו לאורך השנים.

איך המידע מסופק מבחינה טכנית?

הנתונים מחולקים לארבעה קובצי Parquet שמכילים יחד כמעט 26 מיליון שורות. הטעינה נעשית דרך ספריית פייתון ייעודית שמתאימה אוטומטית את מחירי הפתיחה והסגירה בהתאם לדיבידנדים ופיצולים.

איך טוענים

טוענים את הנתונים ישירות בפייתון בעזרת הספרייה pwb-toolbox דרך הפונקציה load_dataset. אפשר לבחור טיקרים ספציפיים כמו מניית אפל כדי לא למשוך את כל 26 מיליון הרשומות בבת אחת. הספרייה מתאימה את המחירים מראש לפי עמודת הסגירה המתואמת, אלא אם מבטלים זאת במפורש. הקבצים שמורים בפורמט Parquet, אך כדי להוריד אותם נדרש אישור גישה שקשור למנוי בתשלום.

from datasets import load_dataset

ds = load_dataset("paperswithbacktest/Stocks-Daily-Price")

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח מוכר. עיון בכרטיס פתוח לכולם, אך הורדת הקבצים דורשת אישור ומנוי בתשלום דרך האתר שלהם. המשמעות היא שאי אפשר להשתמש בנתונים בצורה חופשית או מסחרית בלי לרכוש מנוי מתאים ולבדוק את תנאי השירות הפרטניים שלו.

הרישיון המלא ב־Hugging Face ↗