GPT
W

graelo/wikipedia

קוד פתוח

graelocc-by-sa-3.0,gfdl2023-06-10

מאגר ערכי ויקיפדיה מעובדים במאות שפות מתאריך 1 ביוני 2023. המאגר נותן טקסט נקי ומוכן לחלוקה לפי שפות לאימון מודלי שפה.

  • 2,844הורדות בחודש
  • 72לייקים

מה זה

המאגר מכיל ערכים מלאים מוויקיפדיה שנאספו ישירות מדאמפים רשמיים ונוצרו במיקור המונים. כל רשומה כוללת ארבעה שדות בסיסיים: מזהה ייחודי, כתובת הקישור המקורית, כותרת הערך והטקסט המלא שלו. אין כאן תיוגים נוספים או מטא דאטה מורכב, רק הטקסט הגולמי של הערך.

הנתונים מחולקים לתצורות שונות לפי שפה ולפי תאריך הגרסה, למשל 20230601.he עבור ויקיפדיה בעברית או 20230601.de עבור גרמנית. כל שפה מנוהלת כיחידה עצמאית עם סט אימון משלה. השונות בנפח המידע בין השפות עצומה: שפות כמו אקאן כוללות דוגמה אחת בלבד, בעוד שפות נפוצות כמו גרמנית או ערבית מגיעות למיליוני רשומות וג'יגה בייטים רבים של מידע.

מתאים ל

  • קדם אימון מודלי שפה

    אימון מודלי בסיס ומודלי מסכות על טקסט אנציקלופדי נקי בשפות מוגדרות.

  • שליפת מידע במערכות RAG

    בניית מאגר ידע סגור לאיחזור עובדות מתוך ערכי ויקיפדיה עדכניים ליוני 2023.

  • הערכת ביצועים רב לשונית

    בדיקת יכולות המודל במגוון רחב של שפות מול מקור טקסטואלי עקבי.

איפה זה נופל

הנתונים משקפים את מצב ויקיפדיה ביוני 2023 בלבד, כך שכל אירוע שהתרחש מאז אינו מופיע בהם. המאגר סובל מחוסר איזון חריג בין שפות, לצד ההטיות המובנות של כותבי ויקיפדיה שהמאגר מציין במפורש שנאספו במיקור המונים ללא סינון עריכתי מיוחד. בנוסף, ערכים מסוימים מכילים תבניות טקסט קצרות או דוגמאות בודדות שאינן מתאימות לאימון רציני.

שאלות
נפוצות

האם הדאטהסט כולל עברית?

כן, קוד השפה he מופיע ברשימת השפות הנתמכות במאגר. ניתן לטעון את הנתונים ישירות באמצעות התצורה המתאימה של תאריך הגרסה.

האם מותר להשתמש במידע למטרות מסחריות?

הרישיונות מאפשרים שימוש מסחרי, אך כוללים דרישת שיתוף זהה ומחייבים מתן קרדיט. מומלץ לבחון את ההשלכות המשפטיות של שיתוף זהה על הפצת המודל הסופי.

מה המשקל של המאגר בעת ההורדה?

הנפח תלוי לחלוטין בשפה שבוחרים להוריד. שפות קטנות שוקלות מגה בייטים בודדים, בעוד שפות כמו גרמנית מגיעות למעל חמישה ג'יגה בייט של קבצי פרקט דחוסים.

מאיזה תאריך הנתונים המופיעים במאגר?

הגרסאות במאגר מבוססות על דאמפ שנלקח ב 1 ביוני 2023. כל שינוי, תיקון או ערך שנוסף בוויקיפדיה לאחר מועד זה אינו נכלל.

איך טוענים

טוענים את המאגר ישירות בספריית הדאטהסטים דרך Hugging Face ומציינים את קוד השפה והתאריך הרצויים כתצורה, למשל 20230601.he. הגישה פתוחה לחלוטין ואין צורך באישורים מיוחדים.

הקבצים שמורים בפורמט פרקט מחולק. השדות העיקריים לעבודה הם title ו text. שימו לב שבשפות הגדולות ההורדה דורשת רוחב פס וזיכרון משמעותיים, בעוד שבשפות נדירות מדובר בקבצים קטנים של קילובייטים בודדים.

from datasets import load_dataset

ds = load_dataset("graelo/wikipedia")

הרישיון

המאגר מופץ תחת רישיונות כפולים: cc-by-sa-3.0 ו GFDL. זה אומר שמותר להשתמש בטקסטים גם לצרכים מסחריים, אבל חובה לתת ייחוס מתאים ולשתף תוכן נגזר תחת אותו הרישיון בדיוק. אם אתם מאמנים מודל שפה, כדאי לבדוק עם עורך דין אם משקלי המודל נחשבים ליצירה נגזרת שמחייבת שחרור פתוח.

הרישיון המלא ב־Hugging Face ↗