GPT
M

monash_tsf

קוד פתוח

Monash-Universitycc-by-4.02022-03-21

מאגר מקיף של סדרות זמן מגוונות שנועד להשוואת ביצועים ואימון מודלים גלובליים. הוא מאגד נתונים מעולמות האנרגיה, הבנקאות, התחבורה והמזג אוויר תחת תקן אחיד.

  • 3,283הורדות בחודש
  • 60לייקים

מה זה

המאגר מרכז 30 דאטהסטים שונים שמגיעים ממקורות ציבוריים ומתחרויות עבר, כולל סדרות שנאספו ישירות על ידי החוקרים. בגלל תדירויות שונות וגרסאות שמכילות או משמיטות ערכים חסרים, הוא מציע בסך הכל 58 וריאציות שונות של נתונים.

המבנה של הרשומות משתנה מאוד בין תחום לתחום. תמצאו שם נתוני צריכת חשמל של מונים חכמים בלונדון, תנועת כלי רכב, נתוני קורונה, שערי ביטקוין, תחזיות מזג אוויר וספירת הולכי רגל במלבורן. חלק מהקבצים מכילים עשרות בודדות של סדרות וחלקם, כמו תעבורת הרשת של קגל, מטפסים לעשרות אלפי סדרות.

השונות הזו מתבטאת גם בתדירות הדגימה ובחלונות החיזוי המוגדרים. המדידות נעות בין רזולוציה של דקה אחת, דרך דגימות של חצי שעה, ועד ממוצעים חודשיים או שנתיים.

מתאים ל

  • השוואת מודלים גלובליים

    בדיקת ביצועים של ארכיטקטורות חיזוי סדרות זמן על פני מגוון רחב של תדירויות ומגזרים.

  • בדיקת עמידות לערכים חסרים

    אימון אלגוריתמים להתמודדות עם מידע מקוטע באמצעות הגרסאות הייעודיות שמכילות ערכים חסרים.

  • חיזוי עונתיות מורכבת

    מודלים לתחום האנרגיה והתחבורה שמתמודדים עם מחזורים יומיים, שבועיים ושנתיים בו זמנית.

איפה זה נופל

הבעיה המרכזית היא חוסר אחידות במאפיינים הסטטיסטיים בין הקבצים השונים. המקורות לוקטו ממקומות עצמאיים לחלוטין ולכן אין כאן שיטת איסוף אחת, ואיכות הנתונים משתנה מסט לסט. בנוסף, הנתונים הם היסטוריים ואינם מתעדכנים בזמן אמת. אם אתם צריכים מודל שמבין התנהגות שוק מקומית בישראל, תצטרכו להביא דאטה משלכם כי כלל המדידות מגיעות ממדינות כמו אוסטרליה, ארה"ב ובריטניה.

שאלות
נפוצות

האם המאגר כולו מגיע בקובץ אחד?

לא. המאגר מורכב מ־36 קבצים, רובם קובצי zip נפרדים לכל דאטהסט וגרסה. אתם יכולים להוריד נקודתית רק את התחום שמעניין אתכם, כמו דאטה של ביטקוין או מזג אוויר.

האם יש נתונים מישראל או תמיכה בעברית?

אין במאגר נתונים ישראליים. הסדרות נאספו בעיקר ממקורות באוסטרליה, ארצות הברית ובריטניה, ומדובר בנתונים מספריים של סדרות זמן כך שטקסט או שפה אינם חלק מהותי מהמידע.

האם מותר להשתמש בזה לפיתוח מוצר מסחרי?

הרישיון של המאגר מוגדר כ־cc-by-4.0 שמתיר זאת, אך החוקרים כתבו בתיאור שהשימוש מיועד למחקר בלבד. בגלל שהמאגר מכיל נתונים ממקורות חיצוניים רבים, כדאי לוודא את הרישיון המקורי של הקובץ שבו אתם משתמשים.

איך טוענים

המאגר מאוחסן כקבצי zip נפרדים עבור כל דאטהסט, כך שאין צורך להוריד את כל הנפח אם אתם צריכים רק תחום ספציפי כמו אנרגיה או כלכלה. הגישה חופשית לגמרי ואין צורך בבקשת הרשאה מיוחדת. כדי לעבוד איתם צריך לחלץ את קובצי הנתונים ולהתאים את הקריאה למבנה הזמנים של כל קובץ, כאשר בחלק מהגרסאות הנתונים כוללים ערכים חסרים שדורשים השלמה לפני שמזינים אותם למודל.

from datasets import load_dataset

ds = load_dataset("Monash-University/monash_tsf")

הרישיון

המאגר מופץ ברישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה מחדש, בתנאי שניתן קרדיט מתאים ליוצרים. עם זאת, בכרטיס המקורי ציינו החוקרים כי כל הנתונים מיועדים למטרות מחקר בלבד, מה שיוצר סתירה מול הרישיון המוצהר. אם אתם מתכננים להשתמש במודל במוצר מסחרי, מומלץ לבדוק את תנאי המקור של כל דאטהסט ספציפי בנפרד.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗