GPT
W

wikipedia-monthly

קוד פתוח

omarkamalicc-by-sa-4.02025-07-13

  • multilingual
  • wikipedia
  • 100K<n<1M
  • 10K<n<100K
  • 10M<n<100M

גיבויים חודשיים של ויקיפדיה בעשרות שפות שמיועדים לאימון מודלי שפה. מקבלים טקסט נקי בחלוקה לפי תאריכים ושפות, כולל דגימות מוכנות להערכה מהירה.

  • 8,916הורדות בחודש
  • 80לייקים

מה זה

המאגר מאגד ערכי ויקיפדיה שנאספו מתוך דאמפים חודשיים של המיזם, ומציע גישה לטקסטים בעשרות שפות שונות. כל תצורה מוגדרת לפי תאריך יעד וקוד שפה, כמו גרסאות חודשיות ספציפיות או קישור לגרסה העדכנית ביותר. המבנה הפנימי של הנתונים מחולק לסט אימון מלא המכיל את כלל הערכים, ולצידו תתי קבוצות מדודות של אלף, חמשת אלפים ועשרת אלפים רשומות שמיועדות לבדיקות מהירות ולהערכת ביצועים.

המבנה הזה חוסך את הצורך לפרוס קובצי דאמפ ענקיים של ויקימדיה או לכתוב סקריפטים מותאמים כדי לנקות את הטקסט מתגיות ויקי. עם זאת, הכרטיס לא מפרט אילו מסנני איכות הופעלו, איך הוסרו דפי הפניה, האם נשמרו קישורים פנימיים או מה בדיוק נעשה עם תבניות וטבלאות. הנתונים מוגשים בצורה ישירה כפי שחולצו, וההבדלים בגודל בין השפות משקפים את היקף התוכן המקורי בכל אחת מהן.

מתאים ל

  • אימון מקדים למודלי שפה

    הזנת כמויות גדולות של טקסט כללי בשפות שונות כדי ללמד את המודל אוצר מילים ומבנה לשוני בסיסי.

  • בדיקת ביצועים מהירה

    שימוש בפיצולים של אלף או עשרת אלפים ערכים לצורך הערכת יכולות שפה בלי להוריד את כל הדאטהסט.

  • מחקר על דאטה רב לשוני

    ניתוח הבדלי כיסוי ואיכות ייצוג בין שפות עתירות משאבים לשפות בעלות נוכחות דלה בוויקיפדיה.

איפה זה נופל

בקרת האיכות נשענת לחלוטין על המצב הגולמי של ויקיפדיה. יש שפות עם מיליוני ערכים לעומת שפות קטנות שמכילות ערכים בודדים בלבד או אפס רשומות, מה שיוצר חוסר איזון חריף באימון רב לשוני. בנוסף, הכרטיס אינו מפרט תהליכי ניקוי מיוחדים, כך שהטקסט עלול לכלול הזיות של עורכים, השחתות שלא שוחזרו או מבנה תחבירי קטוע שנובע מהסרת תבניות. אם המטרה היא להפיק מודל לפרודקשן, חובה לבצע סינון נוסף כדי להסיר דפים קצרים מדי וטקסטים באיכות ירודה.

שאלות
נפוצות

האם המאגר כולל עברית?

כן. קיימת תצורה מלאה של השפה העברית הכוללת 381,145 רשומות בסט האימון, לצד פיצולים מוכנים של אלף, חמשת אלפים ועשרת אלפים ערכים.

האם מותר להשתמש בנתונים למטרות מסחריות?

כן, רישיון cc-by-sa-4.0 מאפשר שימוש מסחרי. יחד עם זאת, חובת השיתוף הזהה עשויה לחול גם על מודלים שנוצרו בעזרתו, ולכן כדאי לבדוק את הדרישה המשפטית לפני שילוב במערכת סגורה.

מה ההבדל בין שימוש במאגר הזה להורדת דאמפ ישירות מוויקימדיה?

המאגר מגיש את הנתונים מחולקים מראש לקובצי Parquet נקיים ומסודרים לפי תאריכים ושפות. הוא כולל תתי קבוצות מוכנות בגדלים קבועים וחוסך את הפירוק והעיבוד של קובצי XML ענקיים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים באמצעות ציון הנתיב omarkamali/wikipedia-monthly יחד עם התצורה הרצויה, למשל ציון תאריך ושפה או שימוש במזהה הגרסה העדכנית. הגישה למאגר פתוחה לגמרי ללא צורך באישור מוקדם. הקבצים נשמרים בפורמט Parquet בחלוקה לפי שפות ותאריכים, מתוך מאגר כולל של 90,101 קבצים. לפני שמושכים את כל המידע כדאי להגדיר מראש רק את השפה הנחוצה, או להשתמש בפיצול הקטן של אלף דוגמאות כדי לוודא ששדות הטקסט מתאימים למבנה של מודל השפה שלכם.

from datasets import load_dataset

ds = load_dataset("omarkamali/wikipedia-monthly")

הרישיון

המאגר מופץ תחת רישיון cc-by-sa-4.0. הרישיון מתיר שימוש מסחרי, אך מחייב מתן קרדיט מתאים ליוצרים המקוריים ושיתוף של יצירות נגזרות תחת אותו הרישיון בדיוק. עבור מפתחי מודלים, תנאי השיתוף הזהה עשוי לחייב שחרור של משקולות המודל שאומן על החומרים באותו אופן.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗