GPT
T

Timeseries-PILE

קוד פתוח

AutonLabmit2024-03-21

  • time-series
  • forecasting

מאגר ענק של סדרות עתיות שנאסף ממקורות ציבוריים מוכרים לטובת אימון מודלי בסיס. הוא מיועד למי שרוצה לאמן או לבחון מודל חיזוי על מגוון תחומים בלי ללקט כל מאגר בנפרד.

  • 5,586הורדות בחודש
  • 43לייקים

מה זה

המאגר כולל כעשרים גיגה בייט של נתונים, עם שלושה עשר מיליון סדרות עתיות ומעל מיליארד נקודות זמן. הרשומות מגיעות משלושה עשר תחומים שונים וכוללות אותות באורכים, במשרעות וברזולוציות זמן מגוונות.

בפנים יש איחוד של כמה מאגרים מוכרים מהספרות. בין המקורות נמצאים תשעת המאגרים של Informer לחיזוי ארוך טווח כמו עומסי חשמל, מזג אוויר ותנועה, ארכיון Monash שמכיל חמישים ושמונה מאגרים לחיזוי קצר טווח, ארכיון UCR ו־UEA שכולל מאה חמישים ותשעה מאגרים לסיווג, וארכיון TSB-UAD שמביא כמעט אלפיים סדרות חד ממדיות לזיהוי חריגות.

התוצאה היא תערובת שמכילה חיישנים, קריאות רפואיות כמו אקג, נתוני תעבורת רשת, מדדים פיננסיים וגם מידע סינתטי. המבנה הפנימי שומר על החלוקה למאגרי המקור.

מתאים ל

  • אימון מודלי בסיס לחיזוי

    שימוש במיליארד נקודות הזמן לאימון מודל רב תחומי שמסוגל לחזות צעדים קדימה באותות שונים.

  • בנצ'מרק לסיווג סדרות עתיות

    הערכת ביצועי אלגוריתמים מול ארכיון UCR המשולב במאגר על פני עשרות קטגוריות.

  • פיתוח מנגנוני זיהוי חריגות

    בדיקת מודלים על תיקיית TSB-UAD המכילה סדרות עם תיוגים ידועים של חריגות קיצון.

איפה זה נופל

הנתונים מגיעים מארכיוני מחקר קיימים, ולכן הם כוללים גם דאטה סינתטי ולא רק מדידות מהעולם האמיתי. הכרטיס לא מפרט תהליך סינון, ניקוי או הסרת כפילויות שבוצע בין המקורות השונים, כך שייתכנו חפיפות או פערי איכות ניכרים בין התיקיות. בנוסף, אין במאגר שום ייצוג ייעודי להקשר ישראלי או נתונים מקומיים. מי שמתכנן מוצר לתחום ספציפי, כמו רפואה או פיננסים, יצטרך לבודד את החלקים הרלוונטיים ולא להסתמך על תערובת האותות כולה בלי בדיקה מקדימה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן. הרישיון המדווח הוא MIT, שמאפשר שימוש מסחרי מלא ללא דרישה לפתוח את הקוד שלכם. חובת הציטוט ומתן הקרדיט עדיין חלה, ויש לוודא שמקורות המשנה אינם מטילים מגבלות סותרות.

כמה מקום צריך לפנות בדיסק בשביל להוריד אותו?

הכרטיס מציין נפח כולל של 20.085 גיגה בייט. המאגר מורכב מ־2,441 קבצים, ולכן כדאי לקחת מרווח ביטחון קל מעבר לנפח זה לצורך חילוץ ועיבוד ראשוני של הנתונים.

האם יש במאגר נתונים מישראל או טקסט בעברית?

לא. מדובר בסדרות עתיות מספריות לחלוטין שמקורן במאגרי מחקר בינלאומיים כמו נתוני תנועה בארצות הברית, נתוני מזג אוויר וקריאות רפואיות. אין במאגר שדות טקסטואליים בעברית או מדדים מקומיים מישראל.

מה ההבדל בין המאגר הזה למאגרים כמו Monash או UCR?

המאגר הזה אינו מחליף אותם אלא מאגד אותם במקום אחד. במקום להוריד בנפרד את Monash, Informer ו־TSB-UAD, קיבצו אותם כאן יחד כדי לספק תשתית אחודה לאימון מודלי יסוד.

איך טוענים

המאגר פתוח להורדה ישירה ללא צורך באישור גישה מוקדם, והוא כולל 2,441 קבצים. משקל הנתונים עומד על קצת יותר מעשרים גיגה בייט, כך שצריך להיערך עם נפח אחסון מתאים לפני המשיכה. הקבצים שמורים בפורמטים מגוונים בהתאם למקורות שלהם, כולל קובצי csv וקובצי פלט ייעודיים. בגלל שמדובר באוסף של ספריות שונות, אין מבנה עמודות אחיד לכל הקבצים, ותצטרכו להתאים את צינור הטעינה לכל תיקיית מקור בנפרד.

from datasets import load_dataset

ds = load_dataset("AutonLab/Timeseries-PILE")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב שיתוף של תוצרי הפיתוח באותו רישיון. המשמעות היא שניתן לאמן עליו מודלים פנימיים או מסחריים, בתנאי ששומרים על הצהרת זכויות היוצרים המקורית של המפרסמים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗