GPT
M

megawika

קוד פתוח

hltcoecc-by-sa-4.02023-05-17

שלושים מיליון פסקאות מוויקיפדיה בחמישים שפות, מחוברות לטקסט המקורי של המקורות שהן מצטטות ברשת. זה מאגר שנבנה ישירות לחקר שאלות ותשובות, תמצות ואיחזור מידע מבוסס מקורות.

  • 95,162הורדות בחודש
  • 42לייקים

מה זה

המאגר מכיל 30 מיליון פסקאות מתוך 50 מהדורות ויקיפדיה שונות, יחד עם טקסט מקור שעבר גירוד וניקוי מתוך קישורי הערות השוליים של אותם ערכים. כל שורה בקבצים מייצגת ערך ויקיפדיה שלם, שכולל את הטקסט המקורי ורשימת רשומות מפורטת. כל רשומה כזו מחזיקה פסקה ספציפית, כתובת אתר ותוכן המקור המצוטט, ניתוח אירועים באמצעות LOME FrameNet, וכמעט 130 מיליון צמדי שאלות ותשובות שחולצו אוטומטית באנגלית.

עבור שפות שאינן אנגלית, החוקרים הוסיפו תרגום מכונה של הפסקאות לאנגלית. החלוקה במאגר נעשית ברמת השפה בלבד, בלי חלוקה מובנית לסט אימון ובדיקה. כל שפה מפוצלת לסדרה של קובצי שורות JSON, כאשר גודל הפיצול משתנה קיצונית לפי היקף השפה, מאלפי קבצים בערבית ועד קבצים בודדים בשפות קטנות.

מתאים ל

  • אימון איחזור מבוסס מקורות

    התאמת פסקאות ויקיפדיה ישירות לטקסט המקורי המגורד מהאתר החיצוני המצוטט בהן.

  • בניית מערכות שאלות ותשובות

    שימוש בכמעט 130 מיליון צמדי שאלות ותשובות באנגלית יחד עם הפסקאות כמקור ידע.

  • חילוץ אירועים וסמנטיקה

    ניתוח יחסים ואירועים בטקסט בעזרת תיוגי FrameNet המובנים שסופקו לכל פסקה.

איפה זה נופל

חלק גדול מהמידע כאן מבוסס על תהליכים אוטומטיים, מה שאומר שיש שגיאות מובנות. התרגומים לאנגלית נוצרו במכונה, שאלות ותשובות חולצו אוטומטית, וניתוח ה־FrameNet נשען על מודל LOME. מעבר לכך, הטקסטים המצוטטים מהרשת עברו גירוד, תהליך שלעיתים מייצר רעש, חצאי משפטים או בעיות קידוד. אין חלוקה מוגדרת למבחן ואימון, מה שדורש מכם לבנות פיצול זהיר כדי למנוע דליפת מידע בין פסקאות מאותו ערך.

שאלות
נפוצות

האם יש תמיכה בעברית?

כן, עברית היא אחת מתוך 50 השפות במאגר, תחת קוד השפה he. היא כוללת פסקאות מוויקיפדיה העברית, קישורי מקור, ותרגומי מכונה לאנגלית.

האם המאגר מתאים לשימוש מסחרי?

הרישיון הוא CC-BY-SA-4.0 ולכן שימוש כזה מותר תחת שיתוף זהה ומתן ייחוס. עם זאת, היוצרים מציינים שהטקסטים המצוטטים גורדו מרחבי הרשת ונועדו למחקר, כך ששימוש מסחרי בתוכן צד שלישי עלול לחשוף אתכם לסיכוני זכויות יוצרים.

האם צריך להוריד את כל 50 השפות יחד?

לא, הנתונים מחולקים לתיקיות נפרדות לפי קוד שפה בפורמט jsonl. אתם יכולים למשוך רק את השפה שמעניינת אתכם בלי להוריד את עשרות אלפי הקבצים האחרים.

איך נאספו הנתונים?

החוקרים לקחו פסקאות מ־50 שפות בוויקיפדיה, עקבו אחרי הקישורים בהערות השוליים וגרדו את תוכן דפי הרשת המקוריים. לפסקאות אלו הם הוסיפו שאלות ותשובות שחולצו אוטומטית, ניתוח סמנטי של LOME, ותרגום מכונה לאנגלית לשפות הזרות.

איך טוענים

טוענים את הנתונים דרך ספריית datasets או ישירות מקובצי ה־jsonl שמחולקים לפי תיקיות שפה, למשל תחת data/he עבור עברית. המאגר עצום ומכיל 50,380 קבצים, כך שמומלץ מאוד להוריד רק את השפה הרלוונטית לכם ולא את כולו. אין צורך באישור גישה מוקדם כדי להוריד. השדות המרכזיים שצריך לשים לב אליהם ברשומות הם פסקת המקור, הטקסט המגורד מהרשת, צמדי השאלות והתשובות, ותרגומי המכונה, כאשר באנגלית שדות התרגום נשארים ריקים.

from datasets import load_dataset

ds = load_dataset("hltcoe/megawika")

הרישיון

המאגר מופץ תחת רישיון CC-BY-SA-4.0 שמחייב מתן קרדיט ושיתוף תחת אותו רישיון בדיוק. המפרסמים מבהירים שהם לא מחזיקים בזכויות היוצרים על הטקסטים שגורדו מהרשת ומייעדים אותם למחקר. אם אתם מאמנים מודל על הנתונים האלה ומפיצים אותו, תנאי הרישיון עשויים לחייב אתכם לשחרר את הנגזרות תחת אותו רישיון חופשי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗