GPT
T

tidytuesday_for_python

קוד פתוח

hollyyfcרישיון לא דווח2024-02-21

  • code
  • statistics

המאגר מאגד מטא דאטה וקישורים ישירים לאתגרי הנתונים השבועיים של קהילת R מהשנים 2023 ועד 2024. הוא חוסך גירוד ידני ומנגיש את הפרויקטים האלה ישירות בסביבת עבודה מבוססת פייתון.

  • 49הורדות בחודש
  • 70לייקים

מה זה

המאגר מכיל רשומות מובנות שנאספו באמצעות סקריפטים של requests ו־BeautifulSoup מתוך עמודי הפרויקט הרשמיים של TidyTuesday בגיטהאב. כל שורה בנתונים מייצגת פרויקט שבועי וכוללת את תאריך הפרסום, שם האתגר, קישורי מקור, תיאור טקסטואלי קצר, מילון נתונים מפורט עם שמות משתנים והסברים, וכן כתובות רשת לצפייה ולהורדה ישירה של הקבצים עצמם.

המבנה הפנימי מחולק לשלושה חלקים עיקריים שכוללים סט מלא, סט אימון וסט ולידציה. הנתונים מאורגנים במבנה היררכי מקונן של JSON וזמינים במקביל גם כטבלאות CSV, כאשר מילוני הנתונים ופרטי הקבצים שמורים בתוך רשימות ומילונים פנימיים כדי לאפשר גישה ישירה לכל קובץ מקור.

מקורות המידע המקוריים מגוונים מאוד ומגיעים מפרסומים ברשת, מאמרים אקדמיים ושיתופי פעולה קהילתיים שעברו עיבוד וניקוי ראשוניים על ידי מובילי המיזם בקהילת R. היוצרת של המאגר הנוכחי ביצעה התאמות מבניות בלבד לצורך התאמת היררכיית הנתונים לספריות פייתון, ללא סינון תוכן מהותי מעבר לבחירת טווח השנים.

מתאים ל

  • אימון מודלים לתקצור טקסט

    הפקת תקצירים מתוך שדות התיאור המילולי ומילוני הנתונים הטכניים של הפרויקטים השונים.

  • סיווג נושאי של מאגרי מידע

    חלוקת הפרויקטים לקטגוריות תוכן שונות על בסיס שמות המשתנים ותיאורי המקור.

  • חילוץ מאפיינים ממטא דאטה

    מיפוי סוגי משתנים ומבני נתונים מתוך מילוני המשתנים המקוננים לצורך ניתוח טכני.

איפה זה נופל

הנתונים מוגבלים לשפה האנגלית בלבד ולשנים 2023 עד 2024, ללא כיסוי של פרויקטים מוקדמים יותר או טקסט בעברית. קיימת הטיה מובנית בנושאים שנבחרו, מאחר שהם משקפים בעיקר את תחומי העניין של קהילת R ונועדו במקור לאימוני ויזואליזציה ולאו דווקא ללמידת מכונה. מעבר לכך, המאגר מספק בעיקר מטא דאטה וקישורים חיצוניים, כך ששינוי בכתובת רשת של צד שלישי עלול להשבית הורדה של קובץ מקור. המבנה המקונן דורש פריקה ידנית ואינו מתאים לשליפה שטוחה מיידית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ להשתמש בו לצרכים מסחריים כלל. בעמוד המאגר לא מוגדר רישיון, מה שאומר שאין לכם היתר שימוש ברור על פי חוק. בנוסף, הנתונים מקשרים למקורות חיצוניים שונים שכל אחד מהם עשוי להחזיק בתנאי שימוש נפרדים ומגבילים.

האם המאגר כולל נתונים בשפה העברית?

לא, כלל הנתונים, התיאורים ומילוני המשתנים נכתבו באנגלית בלבד. המקורות מגיעים מקהילות בינלאומיות של שפת R ואין בהם תוכן מקומי. אם אתם זקוקים לדאטהסט בעברית תצטרכו לתרגם את הטקסטים בעצמכם או לחפש מקור אחר.

במה המאגר הזה שונה מהפרויקט המקורי בגיטהאב?

הפרויקט המקורי מתנהל במבנה תיקיות ייעודי לשפת R ודורש עבודה ידנית כדי למצוא קבצים ומילוני משתנים. המאגר הזה ביצע גירוד של העמודים וארגן את כל המטא דאטה, התיאורים וקישורי ההורדה בפורמטים מובנים של JSON ו־CSV שמותאמים לעבודה ישירה בפייתון.

איך נאספו הנתונים לתוך המאגר?

היוצרת כתבה סקריפטים בפייתון שהשתמשו בספריות requests ו־BeautifulSoup כדי לסרוק את עמודי המאגר הרשמי של TidyTuesday. הסקריפטים חילצו את תאריכי הפרסום, שמות הפרויקטים, התיאורים ומבנה המשתנים ישירות מתוך קוד ה־HTML של הפוסטים השבועיים.

איך טוענים

טוענים את המידע ישירות באמצעות ספריית datasets עם הפקודה load_dataset("hollyyfc/tidytuesday_for_python"). המאגר פתוח לציבור ואינו דורש אישורי גישה מיוחדים, טוקנים או הרשמה מוקדמת. השדות המרכזיים לעבודה שוטפת הם description לצד data_dictionary שמכיל את תיאורי המשתנים, ו־data_load שמספק קישורים ישירים להורדת קובצי המקור. מאחר שהשדות האלה מקוננים, תצטרכו לפרק רשימות ומילונים לפני שתזינו אותם למודלים סטנדרטיים.

from datasets import load_dataset

ds = load_dataset("hollyyfc/tidytuesday_for_python")

הרישיון

היוצרת לא דיווחה על רישיון שימוש בעמוד המאגר. מבחינה משפטית, היעדר רישיון מוגדר משאיר את כל זכויות היוצרים אצל היוצרים המקוריים ואינו מעניק הרשאה מפורשת לשימוש מסחרי, הפצה מחדש או אימון מודלים פנימיים. נוסף על כך, כל קובץ מקור שמקושר מתוך המאגר עשוי להחזיק ברישיון נפרד שלא נבדק, כך שאי אפשר להסתמך עליו במוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗