GPT
B

BOOM

קוד פתוח

Datadogapache-2.02025-04-30

  • time-series
  • forecasting
  • observability
  • foundation models
  • boom

יש כאן גם סקירה על Datadog עצמו.

המאגר מרכז כ־350 מיליון נקודות זמן אמיתיות ממערכות ניטור תוכנה ותשתיות ענן. הוא מיועד למי שמפתח מודלים לחיזוי סדרות עתיות ורוצה לבחון אותם מול נתונים תפעוליים רועשים במקום מול סדרות סינתטיות ונקיות.

  • 3,844הורדות בחודש
  • 36לייקים

מה זה

הנתונים מורכבים מ־2,807 שאילתות מטריקה שונות שחולצו מלוחות בקרה, מחברות עבודה והתראות. בסך הכל יש כאן 32,887 משתנים, כשכל רשומה מייצגת סדרה חד-משתנית או רב-משתנית עם עד 100 משתנים במקביל. כל סדרה כוללת תיוג לפי תחום כמו תשתית, רשת, אבטחת מידע ובסיסי נתונים, וסיווג לפי סוג המטריקה דוגמת קצב, מונה או היסטוגרמה.

Datadog דגמה את המדדים מתוך סביבות פיתוח ובדיקות פנימיות של החברה ולא מתוך נתוני לקוחות. תהליך הסינון הראשוני היה בסיסי למדי, וכלל רק הסרה של סדרות ריקות לחלוטין או קבועות לחלוטין, לצד השלמה חישובית של ערכים חסרים. הסדרות שנותרו שונות מאוד זו מזו בתדירות הדגימה שלהן, באורך ציר הזמן ובכמות המשתנים המקבילים.

מתאים ל

  • הערכת מודלי חיזוי

    בדיקת ביצועים של מודלי שפה או מודלי בסיס לסדרות עתיות מול רעש תפעולי אמיתי.

  • אימון לזיהוי חריגות ענן

    התאמת ארכיטקטורות לזיהוי קפיצות פתאומיות ומגמות קריסה במדדי זיכרון ומעבד.

  • חיזוי עומסים מבוזרים

    אימון מודלים רב-משתניים לחיזוי קצב קריאות ופקודות בשירותי רשת ומסדי נתונים.

איפה זה נופל

כל המטריקות נאספו מסביבות טרום-ייצור בלבד, כך שהן לא משקפות בהכרח עומסי שיא או התנהגות משתמשים בסביבות ייצור חיות. הנתונים מתאפיינים בהרבה ערכי אפס, אי-סדירות גבוהה ושונות כבדה עקב תקלות עבר חריגות. אין כאן טקסט בשום שפה ואין רלוונטיות לעברית, שכן מדובר במספרים טהורים. מי שבונה מודל למוצר סופי חייב לקחת בחשבון שחסרים כאן נתוני אמת מלקוחות קצה, ושתהליך ההשלמה של ערכים חסרים כבר שינה חלק מהאות המקורי.

שאלות
נפוצות

האם מותר להשתמש בנתונים האלה למוצר מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי מלא. מותר לאמן על המאגר מודלים ולשלב אותם במוצר, כל עוד מקפידים על מתן קרדיט וצירוף תנאי הרישיון המקוריים.

האם הדאטהסט כולל טקסט או תמיכה בעברית?

המאגר אינו מכיל שפה טבעית כלל, לא באנגלית ולא בעברית. מדובר בנקודות זמן מספריות של מטריקות טכניות ובתיוגים קצרים של סוג המדד, כך ששפה אנושית אינה פקטור בעבודה איתו.

איך הנתונים נאספו והאם יש בהם מידע על לקוחות?

הנתונים נאספו מתוך ממשק שאילתות פנימי של Datadog שעקב אחרי סביבות פיתוח ובדיקות בלבד. המפרסמים מדגישים שאין במאגר נתוני לקוחות, מה שמגן על פרטיות אך גם מרחיק את הנתונים מהתנהגות ייצור אמיתית.

במה המאגר הזה שונה ממאגרי סדרות עתיות נפוצים אחרים?

סדרות נתונים אקדמיות רגילות נוטות להיות מחזוריות ונקיות. הנתונים כאן מציגים אנטרופיה ספקטרלית גבוהה, זנבות כבדים של שגיאות מערכת, וריבוי ערכי אפס שנובעים מאירועים נדירים ברשתות ובמחשוב ענן.

איך טוענים

המאגר מחולק ל־8,429 קבצים בפורמט Arrow, שמסודרים בספריות פנימיות ופתוחים להורדה ישירה דרך Hugging Face ללא צורך בהרשמה מוקדמת או אישור מיוחד. לכל סדרה מצורף קובץ JSON שמתאר את מטא-הנתונים הקריטיים לריצה, כולל תדירות הדגימה, אורך הסדרה, זמן ההתחלה, סוג המטריקה והתחום אליו היא שייכת. קוד הערכה מוכן ומודלים לדוגמה זמינים בריפוזיטורי חיצוני של Datadog בשם toto.

from datasets import load_dataset

ds = load_dataset("Datadog/BOOM")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון. מותר לאמן מודלים על הדאטהסט ולהשתמש בהם במוצרים מסחריים בלי חובה לחשוף את קוד המקור של המודל או לשתף אותו תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗