GPT
U

UTSD

קוד פתוח

thumlapache-2.02024-06-01

  • time series forecasting
  • time series analysis
  • time series

מאגר נרחב של עד מיליארד נקודות זמן משבעה תחומים שונים, שנועד לאימון מודלי בסיס לחיזוי. הוא פותר את הצורך באיסוף וניקוי של עשרות מקורות נפרדים ברשת.

  • 2,129הורדות בחודש
  • 38לייקים

מה זה

הנתונים מורכבים מסדרות זמן מגוונות שנאספו ממאגרים אקדמיים פתוחים כמו Monash, UCR ו־ERA5, לצד נתוני מכונות מחיישני IoT בעולם האמיתי. הרשומות מחולקות לשבעה תחומים: אנרגיה, סביבה, בריאות, IoT, טבע, תחבורה ורשת. בין הדוגמאות אפשר למצוא מדידות של מוני חשמל חכמים בלונדון, קריאות לחץ דם, מדדי PM2.5 בבייג'ינג ותעבורת אתרים.

המאגר מאורגן בארבע רמות גודל היררכיות: UTSD-1G, UTSD-2G, UTSD-4G ו־UTSD-12G. כל רמה קטנה היא תת-קבוצה של הרמה שמעליה, כאשר הסטים הגדולים יותר מכילים סדרות זמן מורכבות יותר מבחינת תחזית ותנודתיות, מה שמתאים לניסויי סקיילינג מבוקרים.

מתאים ל

  • אימון מודלי בסיס לחיזוי

    אימון מודלים גנרטיביים גדולים על כמויות עצומות של סדרות זמן ממגוון תחומים.

  • בדיקות סקיילינג מבוקרות

    בחינת ביצועי מודל החיזוי במעבר בין תתי-המאגרים מ־1G ועד ל־12G.

  • השוואת ביצועי מודלים

    שימוש בנתונים כבנצ'מרק רב-תחומי מקיף למדידת דיוק באלגוריתמים שונים.

איפה זה נופל

השונות בדחיסות הנתונים קיצונית מאוד, החל מדגימות של אלפית השנייה בנתוני מוח ועד לקריאות יומיות במזג אוויר. חלק מהסדרות מגיעות ללא תדירות מוגדרת בכלל, מה שמקשה על אימון אחיד. רוב המידע נשען על מקורות אקדמיים ישנים מסין, לונדון או אוסטרליה, ולכן חסרה כאן רלוונטיות ישירה לפעילות מקומית בישראל. בנוסף, חוסר האחידות באורכי הרצפים ידרוש מכם כתיבת שכבת עיבוד מקדים מורכבת לפני שתוכלו להזין אותו למודל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון apache-2.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים המוטמעים במוצרים סגורים. עליכם לכלול את תנאי הרישיון המקוריים ולתת ייחוס ליוצרים. מומלץ לבדוק את מקורות הנתונים הבודדים במידה והמוצר דורש עמידה ברגולציה מחמירה.

איך בנויים הגדלים השונים של המאגר?

המאגר מחולק לארבע מדרגות קיבולת: 1G, 2G, 4G ו־12G. כל מדרגה גדולה מכילה את קודמתה בתוספת נתונים מורכבים יותר מבחינה סטטיסטית. החלוקה הזו נועדה לאפשר בדיקות ביצועים בהתאם לנפח המידע.

האם יש במאגר נתונים מישראל או טקסט בעברית?

אין במאגר נתונים מישראל או שדות בעברית. מדובר בנתונים נומריים בלבד של סדרות זמן שנאספו ממדינות כמו סין, בריטניה ואוסטרליה. הנתונים מתאימים למשימות חיזוי כלליות שאינן תלויות בשפה.

מאיפה הגיעו הנתונים שנכללים במאגר?

החלק הארי של המאגר לוקט ממאגרי מחקר פתוחים ומוכרים כמו UCR, Monash ונתוני מזג אוויר של ERA5. בנוסף שולבו נתוני אמת של חיישני מכונות תעשייתיות. רשימת המקורות המלאה מפורטת בקובץ המצורף לסט.

איך טוענים

הקבצים שמורים בפורמט Arrow ומחולקים לעשרות חלקים, למשל תיקיית UTSD-12G שכוללת שמונים קבצים נפרדים. הגישה פתוחה לחלוטין ואין צורך באישור מיוחד כדי להוריד. הטעינה נעשית דרך סקריפטים שהחוקרים פרסמו בגיטהאב, או בגרסת NumPy ייעודית. נקודה שחייבים לקחת בחשבון בקוד היא שאורך הרצפים אינו אחיד, כך שתצטרכו לחתוך או לרפד את הדגימות בעצמכם.

from datasets import load_dataset

ds = load_dataset("thuml/UTSD")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם. הדרישה העיקרית היא מתן קרדיט ברור ושמירה על הודעת הרישיון והזכויות המקורית. אין חובה לשתף את הקוד או את המודל שלכם תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗