GPT
W

wikipedia

קוד פתוח

wikimediacc-by-sa-3.0,gfdl2022-03-02

טקסטים נקיים מעשרות שפות מתוך ויקיפדיה, שנשמרו מראש כקובצי פארקט מוכנים לעבודה. החומר מתאים למי שבונה מודלי שפה ורוצה לחסוך חילוץ ידני מדאמפים גולמיים.

  • 257,194הורדות בחודש
  • 1,427לייקים

מה זה

המאגר מכיל תכנים מתוך ויקיפדיה שנאספו ישירות ממיזמי ויקימדיה ברחבי העולם. הרשומות מחולקות לפי שפות שונות, וכוללות מאות תצורות נפרדות עבור כל שפה שנתמכת במיזם. המבנה מאורגן כך שכל קונפיגורציה מייצגת שפה ספציפית ומכילה חלוקה אחת של אימון.

מקור המידע הוא הערכים האנציקלופדיים שנכתבו על ידי קהילות העורכים של ויקיפדיה. הטקסטים אורגנו בקובצי פארקט דחוסים, ללא פירוט מורחב בכרטיס לגבי אופן הסינון של שגיאות, תבניות ויקי או תגיות עיצוב. הנתונים מתועדים לפי תאריכי הדאמפ, כאשר הדוגמאות מציגות גרסאות שנלכדו בתחילת נובמבר 2023.

החלוקה כוללת מאות שפות, החל משפות נפוצות מאוד עם מיליוני פריטים ועד שפות נדירות שמכילות פחות מאלף רשומות. כל שפה יושבת בנתיב נפרד משלה, מה שמאפשר לקחת רק את הנתונים הנחוצים לפרויקט בלי למשוך את כל 557 הקבצים שקיימים במאגר.

מתאים ל

  • אימון מקדים של מודלי שפה

    לימוד בסיסי של תחביר ועובדות כלליות על גבי עשרות שפות מתוך טקסט אנציקלופדי מסודר.

  • משימות השלמת מילים

    אימון והערכה של מודלים לחיווי מילים חסרות בטקסט רציף.

  • בניית מאגרי מידע לשליפה

    שימוש בטקסטים כמקור ידע חיצוני עבור מערכות חיפוש ומענה לשאלות.

איפה זה נופל

הנתונים משקפים רק את מה שנכתב בוויקיפדיה עד למועד הגזירה בנובמבר 2023. אירועים מאוחרים יותר לא קיימים כאן. הטקסט כולל הטיות כתיבה טבעיות של קהילת העורכים, ויש פער עצום בגודל ובאיכות בין שפות עשירות לשפות שמכילות מעט מאוד ערכים קצרים. הכרטיס לא מציין תהליך סינון של מידע שגוי או תוכן לא הולם. אם אתם בונים מערכת שמיועדת לענות לשאלות עובדתיות, חייבים לבצע ניקוי והערכה עצמאית של המידע לפני שמשלבים אותו במוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיונות המדווחים מאפשרים שימוש מסחרי, אבל כוללים סעיפי ייחוס ושיתוף זהה. אם המודל יוגדר כיצירה נגזרת, תיתכן דרישה לשחרר אותו באותו רישיון פתוח. מומלץ לבדוק את ההיבט המשפטי לפני הטמעה במוצר סגור.

האם המאגר כולל טקסטים בעברית?

כן, השפה העברית מופיעה ברשימת השפות הנתמכות תחת הסימול המתאים. ניתן לטעון ישירות את התצורה של העברית בלי למשוך שפות אחרות.

כמה שוקל הדאטהסט המלא?

המשקל הכולל אינו מצוין במספר אחיד בכרטיס, אך המאגר כולל 557 קובצי פארקט שמכסים מאות שפות ברמות גודל שונות. שפות מסוימות מכילות מיליוני רשומות ואחרות פחות מאלף, כך שהנפח תלוי בשפה שבוחרים להוריד.

איך נאספו וסוננו הנתונים?

הטקסטים נלקחו ישירות מתוך מיזמי ויקימדיה השונים לפי חיתוך תאריך של נובמבר 2023. כרטיס המאגר אינו מפרט תהליכי ניקוי מיוחדים, ולכן יש לצפות למבנה טקסט שנאמן למקור בוויקיפדיה.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה בעזרת ציון המזהה ושם התצורה של השפה הרצויה, כמו עברית או אנגלית. אין צורך באישור גישה או במפתח סודי, המאגר פתוח לגמרי להורדה ישירה. הקבצים שמורים בפורמט פארקט יעיל ומפוצלים לפי שפות, כך שאין צורך להוריד את כל המאגר בבת אחת. מומלץ לוודא שיש מספיק זיכרון עבודה בעת טעינת שפות גדולות, ולבדוק את מבנה השדות של הטקסט מיד לאחר הטעינה הראשונית.

from datasets import load_dataset

ds = load_dataset("wikimedia/wikipedia")

הרישיון

התוכן מופץ תחת רישיונות פתוחים מסוג שיתוף זהה ורישיון התיעוד החופשי של גנו. מותר להשתמש במידע גם למטרות מסחריות, אך יש חובה לתת קרדיט למקור. דרישת השיתוף הזהה מחייבת שכל יצירה נגזרת תופץ באותם תנאים. עבור מודלים שמאומנים על המאגר, זה מעלה סיכון משפטי לגבי שחרור משקלי המודל עצמם ברישיון פתוח, ולכן כדאי להתייעץ לפני שימוש במוצר מסחרי סגור.

הרישיון המלא ב־Hugging Face ↗