GPT
S

structured-wikipedia

קוד פתוח

wikimediacc-by-sa-4.02024-09-19

  • wikipedia
  • wikimedia
  • structured-data
  • parquet
  • knowledge-base

ערכי ויקיפדיה באנגלית ובצרפתית מעובדים מראש לטבלאות פארקט אחידות. זה חוסך את הסיוט של כתיבת מנתח עצמאי לטבלאות, הערות שוליים ותבניות מידע.

  • 6,584הורדות בחודש
  • 394לייקים

מה זה

המאגר מכיל 10,468,881 רשומות, כאשר כל שורה מייצגת צילום מצב של ערך ממרחב הערכים הראשי. המידע נשלף ישירות מתוך ה־API של ויקימדיה אנטרפרייז, וכולל שדות בסיסיים כמו כותרת, מזהה, כתובת, פסקת פתיחה ותיאור קצר, לצד קישור לישות תואמת בוויקינתונים.

החלוקה הפנימית מופרדת לשתי שפות בלבד. החלק האנגלי מחזיק 7,597,149 שורות שמפוזרות על פני 86 קבצים, והחלק הצרפתי כולל 2,871,732 שורות ב־26 קבצים. לא נעשה כאן סינון של תוכן מעבר להתמקדות במרחב הערכים הרשמי, אך המאגר כולל ציוני מהימנות ומודלים שמנסים להעריך אם עריכה צפויה להתבטל או אם חסר מקור לטענה מסוימת.

כדי לייצב את מבנה הנתונים בין הקבצים, המפרסמים הפכו שדות היררכיים מורכבים כמו טבלאות, תיבות מידע והערות שוליים למחרוזות ג'ייסון דחוסות. זה אומר שחלק מהנתונים דורש פענוח נוסף בקוד ולא מגיע כשדות עמודתיים טהורים.

מתאים ל

  • שליפת מידע למערכות RAG

    חלוקת המאמרים לפסקאות ומקורות מאפשרת להחזיר תשובות עם מזהה הערת השוליים המדויק.

  • אימון מקדים של מודלי שפה

    הזנת טקסט אנציקלופדי נקי ומובנה באנגלית ובצרפתית ישירות מתוך קובצי פארקט.

  • חילוץ עובדות מטבלאות ותבניות

    בניית מאגרי ידע מטבלאות ותיבות מידע שכבר חולצו למבנה נתונים אחיד.

איפה זה נופל

מדובר בגרסת בטא עם בעיות מוכרות. יש אחוז קטן של ערכים כפולים, מחוקים או חסרים, וכדי לסנן כפילויות צריך לבדוק ידנית את מזהה הגרסה הגבוה ביותר. בערכים ארוכים מאוד ייתכנו פערים במבנה עקב מגבלות עומק, וחלק מהמבנים ההיררכיים שוטחו כדי לא לשבור מנועי פארקט. המאגר מוגבל לאנגלית וצרפתית בלבד, כך שאין כאן עברית בכלל. בנוסף, התיעוד מציין הטיות מובנות של עורכי ויקיפדיה, כולל ייצוג חסר של נשים בנושאי ביוגרפיות והטיות תרבותיות.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. המאגר הזה מכיל אך ורק את המהדורות באנגלית ובצרפתית. מי שצריך עברית יצטרך לפנות ל־API של ויקימדיה אנטרפרייז או לעבד דאמפ עצמאי.

האם מותר להשתמש בזה למוצר מסחרי?

הרישיון מאפשר שימוש מסחרי, אבל כולל דרישת שיתוף זהה קשוחה לצד חובת ייחוס. אם אתם בונים מאגר נגזר או מתאימים את הנתונים, תצטרכו לשחרר את התוצאה תחת אותו רישיון בדיוק.

כמה מקום צריך לפנות בדיסק?

המאגר כולו שוקל 44.42 גיגה בייט בפורמט פארקט דחוס. החלק של השפה האנגלית שוקל 34.61 גיגה, והחלק הצרפתי שוקל 9.81 גיגה.

במה המאגר הזה שונה מסתם הורדה של ויקיפדיה?

הוא חוסך את שלב הפענוח של קובצי ה־XML וה־HTML הגולמיים. ויקימדיה פירקו מראש את הטבלאות, ההפניות והתבניות לשדות מוגדרים היטב.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון שם המאגר והתצורה הרצויה, enwiki_namespace_0 או frwiki_namespace_0, במצב זרימה או בהורדה מלאה. אפשר לעבוד ישירות מול קובצי הפארקט עם פולארס, דאקדק או פייארו דרך נתיבי ה־URL של האגינג פייס. המשקל הכולל מגיע ל־44.42 גיגה בייט, כאשר האנגלית תופסת 34.61 גיגה והצרפתית 9.81 גיגה. אין צורך באישור גישה מיוחד. בעבודה עם שדות כמו sections, infoboxes ו־tables חייבים להריץ json.loads בזמן הקריאה, כי הם שמורים כמחרוזות כדי למנוע קריסה של הסכמה.

from datasets import load_dataset

ds = load_dataset("wikimedia/structured-wikipedia")

הרישיון

המאגר מופץ תחת רישיון cc-by-sa-4.0. מותר להשתמש בו לצרכים מסחריים, אך חובה לתת ייחוס ברור לוויקיפדיה, לקשר לערך המקורי, ולציין אם נעשו שינויים. החלק המורכב הוא דרישת השיתוף הזהה. אם אתם יוצרים יצירה נגזרת שמשלבת את הנתונים, אתם מחויבים להפיץ אותה תחת אותו רישיון בדיוק, מה שמייצר בעיה משפטית לא פשוטה אם מאמנים מודל סגור או מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗