GPT
C

chronos_datasets

קוד פתוח

autogluonother2024-06-22

אוסף ענק של סדרות עיתיות מגוונות לצד דאטה סינתטי ששימש לאימון מודלי הבסיס מסוג Chronos. שווה להגיע אליו אם רוצים לבחון מודל על עשרות מדדי ייחוס מוכרים במבנה אחיד בלי לנקות כל מקור בנפרד.

  • 32,202הורדות בחודש
  • 75לייקים

מה זה

המאגר מאגד עשרות חלוקות משנה שונות שמכילות רצפי זמן עם מזהה, ציר זמן ומטרות חיזוי. הנתונים מייצגים תחומים מגוונים: צריכת חשמל, מזג אוויר, תחבורה, מכירות קמעונאיות כמו M5, ותחרויות קלאסיות מסדרת M וארכיון מונאש. כל רשומה כוללת לרוב מזהה ייחודי, מערך של חותמות זמן ומערך של ערכים נומריים מסוג נקודה צפה.

לצד הנתונים האמיתיים, המאגר כולל שני קובצי ענק סינתטיים שנוצרו במיוחד לאימון: אחד מכיל מיליון סדרות שנוצרו על בסיס גרעינים, והשני מכיל עשרה מיליון סדרות בשיטת ערבוב. המקורות המקוריים נאספו ממאגרים ציבוריים, תחרויות קגל, מחקרים אקדמיים וארכיוני נתונים פתוחים, כאשר המפרסמים ארגנו אותם בתבנית שטוחה ונוחה לקריאה.

מתאים ל

  • אימון מודלי בסיס לחיזוי

    אימון מודלים על מיליוני הסדרות הסינתטיות כדי ללמד אותם דפוסים כלליים של מגמות ועונתיות.

  • בנצ'מרק של ארכיטקטורות

    השוואת ביצועים מול נתוני אמת מבוססים מתחרויות עבר מוכרות כמו M4, M5 וארכיון מונאש.

  • חיזוי ביקושים תפעוליים

    בדיקת אלגוריתמים על תצורות ייעודיות של צריכת חשמל עירונית, מוניות ומזג אוויר בתדירויות שונות.

איפה זה נופל

הכרטיס לא מדווח על ניקוי שגיאות או טיפול בערכים חסרים שבוצעו במקורות המקוריים, כך שכל סט מביא איתו את הרעשים של הדאטה הגולמי שלו. אין פה טקסט רלוונטי ולכן שאלת השפה לא חלה, אבל ההטיות הגאוגרפיות ברורות: רוב נתוני התחבורה והאנרגיה מגיעים מארצות הברית, בריטניה או מקסיקו סיטי. בנוסף, הנתונים הסינתטיים עשויים להכיל תבניות סטטיסטיות מלאכותיות שלא מייצגות תנודות קיצוניות בעולם האמיתי, כך שלא הייתי משליך מביצועים עליהם ישר לפרודקשן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא באופן גורף. המאגר מכיל עשרות מקורות שונים תחת רישיונות נפרדים, מחלקם חופשיים כמו MIT ועד תנאי תחרויות מגבילים. עליכם לבדוק את הרישיון של כל תצורה בנפרד לפני השימוש בה לאימון מודל מסחרי.

כמה שטח אחסון צריך כדי להוריד את הכל?

הורדה של כל המאגר דורשת מעל מאה גיגה בייט של תעבורה ואחסון, בעיקר בגלל קובץ הערבוב הסינתטי ששוקל לבדו מעל 82 גיגה בייט. מומלץ לטעון רק את התצורות הנקודתיות שדרושות לכם למחקר.

האם יש במאגר נתונים מישראל או התאמה לעברית?

המאגר עוסק כולו בסדרות עיתיות נומריות ולא בטקסט, כך שאין משמעות לעברית. הנתונים הגאוגרפיים שנאספו מגיעים בעיקר מאוסטרליה, ארצות הברית, בריטניה ומקסיקו, ללא נציגות ישראלית במקורות המדווחים.

מה ההבדל בין התצורות הרגילות לחלקים הסינתטיים?

התצורות הרגילות הן מדידות אמיתיות מהעולם כמו מזג אוויר או תחבורה, ומכילות לרוב אלפי רשומות לכל היותר. החלקים הסינתטיים מכילים מיליוני רצפים מלאכותיים שנוצרו במיוחד כדי לספק נפח אימון למודלי יסוד.

איך טוענים

טוענים תצורה ספציפית בעזרת ספריית datasets של Hugging Face, תוך ציון שם החלק הרצוי. אין צורך באישור גישה מיוחד, המאגר פתוח להורדה ישירה ומאוחסן בקובצי Parquet. חובה לקחת בחשבון את גודל התצורות: החלק הסינתטי של עשרת המיליונים שוקל מעל 82 גיגה בייט להורדה, בעוד תצורות בוחן סטנדרטיות שוקלות מגה בייטים בודדים עד מאות בודדות. השדות העיקריים שמעניינים אתכם בקוד הם timestamp וערך ה target.

from datasets import load_dataset

ds = load_dataset("autogluon/chronos_datasets")

הרישיון

הרישיון הכולל של המאגר מוגדר כ־other, מכיוון שהוא מורכב מעשרות תת סטים עם רישיונות שונים לחלוטין. חלק מהתצורות מגיעות תחת CC BY 4.0, Apache 2.0 או MIT, אך חלקים אחרים, כמו נתוני תחרויות מסוימים, כפופים לחוקי שימוש מקוריים שלא כולם מתירים מסחר. אם אתם מאמנים מודל שמיועד למכירה או למוצר מסחרי, אתם חייבים לבודד אך ורק את התצורות שמתירות שימוש כזה ולא להשתמש במאגר כמקשה אחת.

הרישיון המלא ב־Hugging Face ↗