GPT
G

GiftEvalPretrain

קוד פתוח

Salesforceapache-2.02024-11-07

  • timeseries
  • forecasting
  • benchmark
  • gifteval

מאגר לאימון מודלי בסיס לחיזוי סדרות עתיות, שמכיל 4.5 מיליון סדרות ו־230 מיליארד נקודות מידע. הוא מותאם במדויק לבנצ'מרק GIFT-Eval בלי דליפת נתונים בין האימון למבחן.

  • 218,764הורדות בחודש
  • 39לייקים

מה זה

המאגר כולל 71 אוספי נתונים חד-ממדיים ועוד 17 אוספים רב-ממדיים, שמגיעים משבעה תחומים שונים ומכסים 13 תדירויות דגימה שונות. שמות הקבצים חושפים נתונים אמיתיים כמו תנועת רכבות תחתיות בבייג'ינג, מערכות מטרו ומדידות כבישים מלוס אנג'לס, ברזולוציות של חצי שעה ומעלה.

הייחוד כאן הוא החלוקה הנקייה. סיילספורס בנו את האוסף הזה במיוחד כדי למנוע זליגת מידע אל מול סט הבדיקה של GIFT-Eval, בעיה כרונית בעולם הסדרות העתיות שבו קשה להשוות מודלים בהגינות. הכרטיס לא מפרט את אופן הניקוי או הסינון המדויק של כל מקור ומקור, אבל המבנה כולו מכוון למטרה אחת, לאפשר אימון מקדים רחב היקף לפני בדיקה בבנצ'מרק.

מתאים ל

  • אימון מודלי בסיס

    אימון מודלי time-series גדולים על מיליארדי נקודות מתחומים מגוונים.

  • הערכה ב־GIFT-Eval

    בניית מודלים שאפשר להעריך בצורה נקייה והוגנת מול הבנצ'מרק התואם.

  • מחקר סדרות רב-ממדיות

    פיתוח ארכיטקטורות שמטפלות ב־17 סטים רב-ממדיים בתדירויות שונות.

איפה זה נופל

בכרטיס נכתב במפורש שהשחרור מיועד למטרות מחקר בלבד סביב המאמר האקדמי. סיילספורס מזהירים שהמאגר לא תוכנן ולא נבדק למטרות מעשיות, בטח לא לתרחישים בסיכון גבוה שבהם שגיאה פוגעת בחיי אדם או בבטיחות. אין כאן תיעוד של הטיות ספציפיות בתוך הנתונים, המקורות מגיעים מתשתיות כמו תחבורה באזורים מסוימים בעולם, ואין שום התייחסות לנתונים ישראליים או כיסוי מקומי. לא הייתי דוחף מודל שאומן עליו ישירות לפרודקשן בלי בדיקות דיוק מקיפות על המידע שלכם.

שאלות
נפוצות

האם יש בדאטהסט מידע מישראל או בעברית?

לא. מדובר בסדרות עתיות מספריות, בעיקר ממערכות תחבורה ותשתיות עולמיות כמו בייג'ינג ולוס אנג'לס. אין בו רכיב טקסטואלי או נתונים מקומיים מישראל.

מה היתרון שלו מול סטים פתוחים אחרים?

היתרון המרכזי הוא ההתאמה המובנית ל־GIFT-Eval ללא דליפת מידע בין האימון לבדיקה. הוא מאגד 88 סטים שונים ב־13 תדירויות, מה שחוסך איסוף ידני ממקורות שונים.

האם אפשר להשתמש בו למוצר מסחרי?

מבחינת המטא-דאטה הרישיון הוא Apache 2.0 שמאפשר שימוש מסחרי, אבל החוקרים כתבו בכרטיס שהשחרור נועד למחקר בלבד. כדאי להתייעץ עם משפטן לגבי הפער הזה לפני שילוב במוצר.

כמה קשה לטעון את כל המידע?

האוסף מכיל 6,682 קבצים בפורמט Arrow עם מיליארדי נקודות מדידה. טעינה מלאה לזיכרון בבת אחת לא מעשית, ועדיף לעבוד עם טעינה לפי מקורות ספציפיים או בסטרימינג.

איך טוענים

הנתונים מחולקים ל־6,682 קבצים בפורמט Arrow בליווי קובצי מטא-דאטה מסוג JSON, מחולקים לפי תיקיות של סדרות הנתונים השונות. אין כאן דרישה לאישור גישה מיוחד, אפשר למשוך אותם ישירות דרך Hugging Face. קחו בחשבון שמדובר בהיקף עצום של 230 מיליארד נקודות, כך שחובה לתכנן מראש אחסון מקומי רחב ועבודה ב־streaming או טעינה מבוזרת לפי התיקיות הספציפיות שאתם צריכים לאימון.

from datasets import load_dataset

ds = load_dataset("Salesforce/GiftEvalPretrain")

הרישיון

הרישיון המדווח במאגר הוא Apache 2.0, שמתיר שימוש מסחרי חופשי, שינויים והפצה של הקוד והנתונים, כל עוד שומרים על הודעת הרישיון והייחוס המקורי. עם זאת, בטקסט הכרטיס החוקרים ציינו שהשחרור מיועד למחקר בלבד ומפנים למדיניות השימוש שלהם, מה שיוצר סתירה מסוימת שצוותים משפטיים ירצו לבחון לפני שימוש מסחרי ישיר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗