GPT
G

GiftEval

קוד פתוח

Salesforceapache-2.02024-10-18

  • timeseries
  • forecasting
  • benchmark
  • gifteval

בנצ'מרק שמיועד להערכת מודלי חיזוי סדרות עתיות במצב אפס דוגמאות. הוא מאגד נתונים מעשרות מקורות כדי לבדוק איך המודל שלכם מתמודד עם דפוסי זמן מגוונים בלי אימון מוקדם.

  • 4,310הורדות בחודש
  • 22לייקים

מה זה

המאגר מכיל 23 דאטהסטים שונים המיועדים למשימות חיזוי סדרות עתיות. בסך הכל יש כאן 144,000 סדרות עתיות שמורכבות מ־177 מיליון נקודות מידע, המחולקות בין שבעה תחומים שונים וכוללות עשרה תדרי דגימה שונים ואורכי חיזוי משתנים. בין הנתונים אפשר למצוא למשל קובצי תנועה כמו לופ סיאטל בתדרי דגימה של חמש דקות, שעה ויום.

הכרטיס לא מפרט תהליכי סינון, ניקוי ספציפיים או את רשימת כל 23 המקורות במלואם, אבל הוא מבהיר שהנתונים נועדו לשמש מבחן ביצועים אחיד למודלי בסיס. לצד המאגר הזה, החוקרים יצרו דאטהסט נפרד לאימון מקדים כדי למנוע דליפת מידע בין שלב האימון לשלב ההערכה.

מתאים ל

  • הערכת מודלי חיזוי

    בדיקת ביצועים של מודלי סדרות עתיות במצב אפס דוגמאות על מגוון תדרים.

  • השוואה ללוח תוצאות

    הרצת מודלים על בנצ'מרק אחיד והגשת התוצאות ללוח המובילים של הפרויקט.

  • מחקר של מודלי בסיס

    בחינת יכולות הכללה של ארכיטקטורות שונות על פני שבעה תחומי ידע.

איפה זה נופל

היוצרים מדגישים בפירוש שהשחרור מיועד למטרות מחקר בלבד ולא נבדק או הותאם לשימושי קצה מסחריים או תפעוליים. אין פירוט לגבי הטיות קיימות במידע, שפות או מדינות המקור מעבר לדוגמאות בודדות כמו סיאטל, ואין מידע על טווח השנים שבו נאספו הנתונים. אם אתם בונים מערכת לתרחישים רגישים או קריטיים, הנתונים האלה לא נבדקו לרמת דיוק או בטיחות שמתאימה למוצר אמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי בעמוד הוא אפאצ'י 2.0, שבאופן כללי מאפשר שימוש מסחרי חופשי למדי. עם זאת, היוצרים הוסיפו בכרטיס הערה מפורשת שהשחרור מיועד למטרות מחקר בלבד ומפנים למדיניות השימוש שלהם. בשל הסתירה הזו, מומלץ לבדוק את העניין משפטית ולא להסתמך רק על הגדרת הרישיון היבש.

האם הדאטהסט כולל נתונים בעברית או מישראל?

אין שום אזכור לנתונים מישראל או לטקסט בעברית בכרטיס הדאטהסט. מדובר במאגר של סדרות עתיות מספריות, כמו נתוני תנועה מעיריית סיאטל, כך ששפה אינה פקטור מרכזי כאן, אך ההקשר הגיאוגרפי והתשתיתי ברובו אינו מקומי.

איך המאגר הזה שונה מנתוני האימון של הפרויקט?

החוקרים פיצלו במכוון את הנתונים ויצרו מאגר נפרד בשם GiftEvalPretrain לצורך אימון המודלים. המאגר הנוכחי משמש כבנצ'מרק בלבד, כדי שתוכלו לבדוק ביצועים על נתונים שהמודל לא נחשף אליהם קודם ולמנוע דליפת מידע בין שלב הלמידה לשלב המבחן.

באילו פורמטים הנתונים שמורים וכמה קבצים יש שם?

המאגר כולל 175 קבצים המחולקים לתיקיות לפי סוג הנתונים ותדרי הדגימה. הנתונים עצמם שמורים בקובצי חץ של אפאצ'י, וכל תיקייה מלווה בקובצי הגדרות ומטא-דאטה בפורמט ג'ייסון שמאפשרים טעינה מסודרת.

איך טוענים

המאגר פתוח לציבור ואינו דורש אישור גישה מיוחד. הוא מורכב מ־175 קבצים שמסודרים בתיקיות לפי מקור ותדר דגימה, ומאוחסנים בפורמט חץ של אפאצ'י לצד קובצי מטא-דאטה והגדרות במבנה ג'ייסון. אפשר לטעון אותו ישירות דרך ספריית הדאטהסטים הרגילה של פייתון, אך קחו בחשבון שיש לבחור את תת-התיקייה הרצויה מתוך המאגר כדי לעבוד עם חיתוך זמן מסוים.

from datasets import load_dataset

ds = load_dataset("Salesforce/GiftEval")

הרישיון

הרישיון המדווח הוא אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הקוד והנתונים, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי ומציינים שינויים שביצעתם. עם זאת, היוצרים הוסיפו הערה לפיה השחרור מיועד למחקר בלבד ומפנים למדיניות השימוש שלהם, מה שמייצר אי-בהירות משפטית שכדאי לבדוק מול ייעוץ משפטי לפני שמכניסים אותו למערכת מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗