GPT
L

lotsa_data

קוד פתוח

Salesforceapache-2.02024-02-22

אוסף רחב של סדרות עתיות פתוחות שמיועד לאימון מודלים גנרליים לחיזוי. מי שבונה מודל בסיס לתחום ימצא כאן נקודת פתיחה טובה במקום לגרד מקורות שונים בעצמו.

  • 39,960הורדות בחודש
  • 96לייקים

מה זה

המאגר כולל סדרות עתיות ממקורות פתוחים מגוונים, ומחולק לתתי תיקיות לפי פרויקטים ספציפיים. בין השאר תמצאו שם נתוני תחבורה כמו תנועת הרכבת התחתית בבייג'ינג במרווחים של חצי שעה, נתוני מטרו מהעיר האנגג'ואו ונתוני חיישני תנועה מסיאטל. המטרה המרכזית שלו היא לאפשר אימון מקדים של מודלי שפה גדולים לסדרות עתיות, תחום שבו לרוב קשה למצוא ריכוז כזה של מידע גולמי.

המבנה הפנימי מורכב מאלפי קבצים שמפוצלים לפי תתי מאגרים עצמאיים. לפי הכרטיס, הנתונים אוגדו יחד כחלק מפרויקט מחקר רחב של החברה ולא נוצרו כולם מאפס על ידה, אלא נאספו מארכיונים פתוחים שונים שקיימים ברשת. אין בכרטיס פירוט מלא לגבי אופן הניקוי, הסינון או הנרמול שנעשו על כל סדרה וסדרה, ולכן צריך לבדוק כל תת תיקייה בנפרד כדי להבין מה מצב הנתונים שלה.

מתאים ל

  • אימון מקדים למודלי חיזוי

    אימון של ארכיטקטורות טרנספורמר על כמויות גדולות של סדרות עתיות מגוונות.

  • חיזוי עומסי תחבורה

    בניית מודלים ייעודיים לתנועה עירונית על בסיס נתוני המטרו והכבישים שבמאגר.

  • השוואת ביצועים במחקר

    בדיקת אלגוריתמים חדשים על בנצ'מרק של נתוני אמת ממספר תחומים שונים.

איפה זה נופל

הכרטיס מצהיר במפורש שהשחרור נועד לצורכי מחקר בלבד ולא נבדק או הותאם למקרי קצה בעולם האמיתי. אין פירוט לגבי הטיות אפשריות, פערי זמנים או בעיות באיכות הדגימה. אם אתם מתכננים לחזות תרחישים רגישים או מערכות קריטיות, תצטרכו לבדוק את הנתונים בעצמכם כדי לוודא שאין בהם עיוותים מסוכנים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי של המאגר הוא אפאצ'י שתיים אפס, שבאופן עקרוני מתיר שימוש מסחרי לחלוטין. עם זאת, היוצרים ציינו בכרטיס שהשחרור מיועד לצורכי מחקר בלבד, ושיש לבחון היטב את ההשלכות לפני שימוש במערכות אמיתיות. כדאי להתייחס להסתייגות הזו ברצינות אם אתם בונים שירות קריטי.

האם יש במאגר נתונים רלוונטיים לישראל או בעברית?

לא, המאגר מורכב מסדרות עתיות ומספרים ולא מטקסט חופשי. הדוגמאות הספציפיות שמפורטות בכרטיס מתייחסות לערים כמו סיאטל, בייג'ינג והאנגג'ואו. אין בו תיעוד מפורש למקורות מידע מקומיים מישראל.

איך בנויים הקבצים בתוך המאגר?

המאגר מכיל מעל ששת אלפים ושבע מאות קבצים שמחולקים לפי תת מאגר. הנתונים עצמם מאוחסנים בקובצי חץ בפורמט ארו, ולכל חלק מצורפים קובצי מידע ומצב בפורמט ג'ייסון. המבנה הזה מותאם לעבודה מהירה עם ספריות נתונים מודרניות.

איך טוענים

הנתונים יושבים במעל ששת אלפים קבצים בפורמט חץ, לצד קובצי מידע ומצב של האגינג פייס. הגישה פתוחה לחלוטין ואין צורך לבקש אישור מראש. כדי לעבוד איתם בצורה הגיונית, כדאי למשוך רק את תתי התיקיות שרלוונטיות לפרויקט שלכם, כמו קובצי התנועה של סיאטל או בייג'ינג, ולא להוריד את כל המאגר בבת אחת בלי צורך.

from datasets import load_dataset

ds = load_dataset("Salesforce/lotsa_data")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של החומר, בכפוף למתן ייחוס מתאים ושמירה על תנאי הרישיון. מותר לאמן עליו מודלים מסחריים בלי חובה לחשוף את הקוד שלכם, אך המפרסמים מדגישים שיש לקחת אחריות מלאה על התוצאות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗