GPT
M

miracl-corpus

קוד פתוח

miraclapache-2.02022-09-29

מאגר פסקאות מוויקיפדיה ב־16 שפות שנבנה עבור משימות אחזור מידע וחיפוש. הוא מציע טקסטים מחולקים ליחידות קריאה אחידות כדי לאמן או להעריך מנועי חיפוש רב-לשוניים.

  • 4,949הורדות בחודש
  • 54לייקים

מה זה

המאגר כולל טקסטים שנלקחו מגרסאות עבר של ויקיפדיה ב־16 שפות שונות, ביניהן ערבית, רוסית, פרסית, אנגלית ותאית. היוצרים השמיטו תמונות, טבלאות ורכיבי מדיה, ושמרו אך ורק את הטקסט הנקי. כל ערך עבר פירוק לפסקאות נפרדות באמצעות הכלי WikiExtractor על בסיס מעברי שורות כפולים במקור, כך שכל פסקה מתפקדת כמסמך עצמאי לצורכי שליפה.

המבנה של כל רשומה כולל שלושה שדות בלבד: מזהה ייחודי, כותרת הערך המקורי, וגוף הפסקה. המזהה מורכב ממספר הערך ואינדקס הפסקה ברצף, מה שמאפשר לשייך את הפסקאות בחזרה לערך השלם. הנתונים מחולקים לפי שפות, כאשר כל שפה מכילה כמות שונה של פסקאות, החל מכ־131 אלף בסוואהילי ועד לכמעט 33 מיליון באנגלית.

מתאים ל

  • אימון מנועי אחזור

    אימון מודלים של חיפוש סמנטי וצפיפות על פסקאות בוויקיפדיה בשפות שאינן עברית.

  • הערכת ביצועי חיפוש

    בדיקת איכות אלגוריתמים לאחזור מידע על בסיס קורפוס טקסט נקי ב־16 שפות שונות.

  • בניית מאגרי וקטורים

    הזנת פסקאות מקוטלגות עם כותרות אל מסדי נתונים וקטוריים לצורכי חיפוש מבוסס תוכן.

איפה זה נופל

עברית חסרה כאן לחלוטין, כך שהמאגר אינו רלוונטי למי שבונה מנוע חיפוש מקומי לשוק הישראלי. בנוסף, הנתונים מתבססים על גיבויי ויקיפדיה ישנים משנים 2019 ו־2022. מידע שנכתב מאז אינו מופיע כאן, ועובדות שהשתנו או תוקנו מאז נשארו בנוסח המקורי הישן. החיתוך השרירותי של טקסטים לפסקאות לפי מעברי שורה יוצר לפעמים קטעים קצרים מדי או חלקי מידע נטולי הקשר שמקשים על הבנה מלאה.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מכיל 16 שפות בלבד, ביניהן אנגלית, ערבית, פרסית, רוסית ואינדונזית, אך עברית אינה חלק מהפרויקט.

האם מותר להשתמש בנתונים לפיתוח מוצר מסחרי?

כן. רישיון apache-2.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים והפצה, בכפוף למתן קרדיט וייחוס מתאים ליוצרים.

מאיפה נאסף הטקסט של המאגר?

כל המידע מבוסס על גיבויים ציבוריים של ויקיפדיה מהשנים 2019 ו־2022. החוקרים ניקו אלמנטים כמו תמונות וטבלאות וחילקו את הטקסט לפסקאות.

מה ההבדל בין השפות השונות במאגר מבחינת נפח?

יש פערי גודל משמעותיים בין השפות. אנגלית כוללת כמעט 33 מיליון פסקאות, בעוד שפות כמו סוואהילי או בנגלית כוללות מאות אלפי פסקאות בלבד.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות העברת המזהה miracl/miracl-corpus ובחירת קוד השפה המבוקש כהגדרה, כמו ar עבור ערבית או en עבור אנגלית. המאגר פתוח להורדה חופשית ואינו דורש אישור גישה מיוחד, טוקן או תהליך הרשמה מוקדם.

הקבצים שמורים בפורמט jsonl דחוס ב־gzip ומחולקים למספר חלקים בכל שפה. לפני שמושכים את השפות הגדולות, צריך לקחת בחשבון את המקום בדיסק ובזיכרון העבודה, כי אנגלית לבדה מחזיקה עשרות מיליוני רשומות. בכל רשומה שנטענת יש גישה ישירה לשדות docid, title ו־text.

from datasets import load_dataset

ds = load_dataset("miracl/miracl-corpus")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי של המידע, שילוב במערכות סגורות ואימון מודלים ללא דרישה לשתף את הקוד או את הנתונים הנגזרים באותו אופן. התנאי המרכזי הוא שימור הודעות זכויות היוצרים והייחוס ליוצרים המקוריים בכל הפצה של הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗