GPT
W

legacy-datasets/wikipedia

קוד פתוח

legacy-datasetscc-by-sa-3.0,gfdl2022-03-02

מאגר ערכי ויקיפדיה נקיים ממגוון שפות, שנועד לאימון מודלי שפה. מי שבוחר בו מחפש טקסט אנציקלופדי מעובד בלי תגיות מרקדאון או הערות שוליים.

  • 83,281הורדות בחודש
  • 662לייקים

מה זה

הנתונים מגיעים ישירות מדאמפים רשמיים של קרן ויקימדיה. כל רשומה מייצגת ערך שלם וכוללת ארבעה שדות פשוטים: מזהה ייחודי, כתובת הקישור, כותרת הערך וגוף הטקסט המלא. הניקוי מבוצע באמצעות הכלי mwparserfromhell, שמסיר עיצובי ויקי, קישורים פנימיים וקטעים כמו הערות שוליים ורפרנסים.

החלוקה בנויה לפי שפות ותאריכי דאמפ, כשכל תצורה מכילה רק פיצול אימון יחיד. חלק מהשפות עברו עיבוד מראש לתאריך מרץ 2022, כמו אנגלית עם 6,458,670 ערכים, גרמנית עם 2,665,357 ערכים, צרפתית ואיטלקית. תצורות שלא הוכנו מראש נבנות בזמן אמת מתוך קובצי המקור לפי השפה והתאריך שמגדירים.

מתאים ל

  • קדם אימון מודלי שפה

    הזנת טקסט עובדתי ומנוסח היטב ללימוד מבנה שפה וידע כללי בסיסי.

  • אימון מודלי מילוי מסכה

    שימוש בערכים אנציקלופדיים שלמים לחיזוי מילים חסרות בהקשר רחב.

  • שליפת מידע ומענה לשאלות

    בניית מאגר ידע סגור לאימון מנועי אחזור מבוססי כותרת וטקסט.

איפה זה נופל

הכרטיס מודה בחסר מוחלט בכל הנוגע לתיעוד הטיות, פרטיות או השפעות חברתיות, והסעיפים האלה פשוט מסומנים כחסרי מידע. הנתונים המעובדים משקפים את המצב במרץ 2022, כך שכל אירוע או עובדה מאז לא קיימים שם. מי שמחפש עברית מוכנה מראש לא ימצא אותה ברשימת התצורות המעובדות של הארכיון הזה, ויצטרך להסתמך על גזירה דינמית מדאמפ מקורי אם הוא זמין. הטקסט מכיל רק מה שמשתמשי ויקיפדיה כתבו, על כל הדעות הקדומות והאי דיוקים האפשריים ברשת.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למטרות מסחריות?

כן, אבל ברישיון יש מלכוד. הטקסט מוגן תחת CC BY-SA 3.0 ו־GFDL, שמחייבים ייחוס ושיתוף תחת אותו רישיון. אם השימוש שלכם נחשב יצירה נגזרת, תצטרכו לפתוח את התוצרים באותם תנאים בדיוק.

האם יש במאגר ערכים בעברית?

המאגר כולל תמיכה כללית במגוון שפות של ויקיפדיה, אבל עברית אינה נמצאת ברשימת התצורות שעובדו מראש על ידי HuggingFace. כדי לקבל עברית תצטרכו להגדיר פרמטר שפה מתאים ולבנות את הדאטהסט מהדאמפ הגולמי בעזרת mwparserfromhell.

כמה מקום בדיסק צריך בשביל לעבוד איתו?

זה תלוי בשפה. הגרסה האנגלית המוכנה דורשת 11.69 גיגה בייט להורדה וכ־32 גיגה בייט בסך הכל בדיסק, בעוד שגרמנית צורכת כ־14.25 גיגה בייט ואיטלקית כ־7.25 גיגה בייט.

איך נוקה הטקסט של הערכים?

הטקסטים נלקחו ישירות מדאמפ רשמי של ויקימדיה וסוננו עם כלי בשם mwparserfromhell. הניקוי כולל הסרה של תבניות מרקדאון, קישורי עריכה, והשמטה של מקורות והערות שוליים שמופיעים בסוף המאמר.

איך טוענים

טוענים את המאגר דרך הספרייה datasets בעזרת load_dataset, ומציינים את השפה והתאריך הרצויים. אם בוחרים תצורה מוכנה כמו אנגלית, ההורדה שוקלת 11.69 גיגה בייט ודורשת כמעט 32 גיגה בייט פנויים בדיסק כדי לפתוח אותה. בתצורות שאינן מוכנות מראש, חייבים להתקין קודם את mwparserfromhell. אין צורך בבקשת גישה מיוחדת או בטוקן אישי. השדה המרכזי לאימון הוא text, ומומלץ להגדיר עיבוד מקבילי כדי לא להיתקע שעות בשלב הפריסה.

from datasets import load_dataset

ds = load_dataset("legacy-datasets/wikipedia")

הרישיון

התוכן מופץ ברישיון כפול של CC BY-SA 3.0 ו־GFDL. זה אומר שמותר להשתמש במידע, כולל לצרכים מסחריים, אבל חובה לתת ייחוס מתאים. החלק המורכב יותר הוא סעיף השיתוף הזהה, ShareAlike. אם אתם יוצרים יצירה נגזרת ישירה מהטקסט, אתם מחויבים להפיץ אותה תחת אותו רישיון בדיוק. ההשפעה המשפטית של הסעיף הזה על משקולות של מודל שאומן על הדאטהסט שנויה במחלוקת, ולא הייתי מכניס אותו למוצר מסחרי סגור בלי ייעוץ משפטי.

הרישיון המלא ב־Hugging Face ↗