GPT
Y

yahoo-finance-data

קוד פתוח

defeatbetaodc-by2024-11-28

  • earnings-call-transcripts
  • market-data
  • stock-data
  • finance-data
  • finance

המאגר כולל עשרות טבלאות פיננסיות בפורמט יעיל שמחברות היסטוריית מסחר עם טקסטים של דוחות ותמלילי שיחות משקיעים. הוא מתאים למי שבונה מודלים לתחזיות כלכליות וניתוח טקסט מבוסס פונדמנטלס.

  • 121,148הורדות בחודש
  • 123לייקים

מה זה

הנתונים מורכבים מכמה סוגי מידע שונים לחלוטין שמקושרים לפי סימול מניה ותאריכים. בצד הכמותי יש נתוני מחירי מניות יומיים, דיבידנדים, ספליטים, תשואות אג״ח ממשלתיות של ארה״ב ושערי חליפין. בצד התאגידי יש דוחות כספיים מלאים, חלוקת הכנסות לפי מגזרים, פרופילי חברות, שכר מנהלים ואירועי דיווח לרשות ניירות ערך האמריקאית. בנוסף, המאגר מכיל שכבת טקסט עשירה שכוללת כתבות חדשות ותמלילים מלאים של שיחות רווח רבעוניות, שבהם הטקסט מחולק לפסקאות לפי דוברים.

המקורות מגיעים מגרד וממשקי API ציבוריים של יאהו פיננס, נאסד״ק, אתר משרד האוצר האמריקאי, אתר YCharts ומאגר הדיווחים של ה־SEC. הכרטיס לא מפרט תהליך סינון, ניקוי ערכים חריגים או אימות נתונים, אלא רק מציג את מקור הגרידה המקורי לכל טבלה ואת שמות השדות שנוצרו.

מתאים ל

  • ניתוח סנטימנט בשיחות רווח

    אימון מודלי שפה על תמלילי שיחות משקיעים לבדיקת הקשר בין טון הדיבור של ההנהלה לתוצאות המניה.

  • בדיקת אסטרטגיות פונדמנטליות

    שילוב נתוני דוחות כספיים, חלוקת הכנסות ומחירי מניות לבניית מודלים כמותיים על פני תקופות שונות.

  • הזנת סוכני מחקר אוטונומיים

    חיבור קבצי הדאטה לכלים מבוססי שפה לצורך מענה מהיר על שכר בכירים, אירועי SEC ונתוני חברות.

איפה זה נופל

כל הטקסטים והדוחות הם באנגלית בלבד ומתרכזים בשוק האמריקאי. הדאטהסט לא כולל מידע על חברות ישראליות שאינן נסחרות בארה״ב. תאריכים שמורים כמחרוזות ולא כסוגי נתונים ייעודיים של זמן, מה שעלול לייצר אי-אחידות בפורמטים. אין תיעוד לגבי חברות שפשטו רגל, ולכן יש סיכון גבוה להטיית הישרדות אם מנסים לאמן מודלים של מסחר כמותי ישירות על המידע הגולמי בלי בדיקה.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. כל הנתונים, הדוחות, החדשות ותמלילי השיחות הם באנגלית בלבד ומתייחסים לשוק ההון האמריקאי ולחברות זרות שמדווחות לרגולטור בארה״ב.

איך ניגשים למידע בלי להוריד את כל הקבצים?

אפשר להריץ שאילתות SQL ישירות על קבצי ה־Parquet דרך DuckDB באמצעות הקישור הישיר לקובץ ב־Hugging Face. זה מאפשר לסנן מניות ספציפיות בלי למלא את הדיסק.

האם המידע מתאים לאימון מודל מסחר מסחרי?

מבחינת רישיון המאגר מוגדר ODC-By שמתיר שימוש מסחרי עם קרדיט, אך המקורות הם גרידה מאתרים כמו יאהו פיננס שמגבילים שימוש כזה. בנוסף, בעמוד המאגר נכתב במפורש שהנתונים נועדו למחקר וחינוך בלבד.

במה הוא שונה ממאגרי מחירי מניות פשוטים?

רוב המאגרים מציגים רק נרות יומיים של מחירים ומחזורים. כאן יש חיבור ישיר לתמלילי שיחות משקיעים מלאים, חלוקת הכנסות פרטנית, שכר מנהלים וקובצי דיווח רשמיים של ה־SEC.

איך טוענים

אין צורך ברישום מיוחד או בקשת גישה. כל המידע שמור בקבצי Parquet ישירות במאגר, כך שאפשר לתשאל אותם בריחוק באמצעות DuckDB בלי להוריד את כל המאגר למחשב. לחלופין, אפשר להשתמש בספריית הפייתון של היוצרים או לחבר סוכני בינה מלאכותית דרך הכלים שהם מציעים. מפתח הזיהוי המרכזי בכל הטבלאות הוא symbol, ותאריכי הדיווח מאוחסנים כמחרוזות טקסט בפורמט report_date, מה שמחייב המרה לתאריכים בפועל לפני עיבוד.

from datasets import load_dataset

ds = load_dataset("defeatbeta/yahoo-finance-data")

הרישיון

הרישיון המדווח הוא ODC-By, מה שמאפשר שימוש, הפצה ועיבוד של הנתונים, כולל למטרות מסחריות, כל עוד נותנים ייחוס מתאים ליוצר. עם זאת, מקור המידע הוא אתרים חיצוניים כמו יאהו פיננס ונאסד״ק שמשתמשים ברישיונות משלהם, והמאגר מציין שהנתונים מיועדים למחקר וחינוך. לכן, שימוש במודל שאומן על המאגר בתוך מוצר מסחרי עלול לעורר שאלות זכויות יוצרים מול ספקי המקור.

הרישיון המלא ב־Hugging Face ↗