GPT
W

wikitext_document_level

קוד פתוח

EleutherAIcc-by-sa-3.02023-03-10

גרסה שמארגנת מחדש את מאגר ויקיטקסט לפי ערכים מלאים במקום שורות בודדות. מי שמאמן מודלים שצריכים הקשר ארוך ומבנה שלם של מאמר ימצא פה פתרון נקי בלי לחבר שברים ידנית.

  • 81,580הורדות בחודש
  • 18לייקים

מה זה

המאגר מחזיק מעל 100 מיליון טוקנים שחולצו מערכים מאומתים בוויקיפדיה, ספציפית כאלה שמוגדרים כערכים מובחרים וטובים. בניגוד לגרסה הקלאסית שחילקה את הטקסט שורה אחרי שורה, כאן כל רשומה כוללת עמוד שלם. הטקסט שומר על אותיות גדולות וקטנות, סימני פיסוק ומספרים מקוריים.

יש כאן ארבע תצורות שונות. הראשונה היא wikitext-103 שמכילה 1,801,350 דוגמאות באימון, 3,760 באימות ו־4,358 בבחינה. השנייה היא wikitext-2, גרסה מוקטנת בהרבה שמחזיקה 36,718 דוגמאות אימון עם אותן כמויות בדיקה. לשתיהן קיימות גרסאות raw שמשאירות את הטקסט הגולמי, מול גרסאות מעובדות שכוללות טוקנים מיוחדים כמו אסימון מילים לא מוכרות.

מתאים ל

  • אימון להקשר ארוך

    אימון מודלי שפה על ערכים שלמים כדי לבחון יכולת מעקב אחר תלויות ארוכות טווח בטקסט.

  • מבחני השוואה ומדדי פרפלקסיטי

    הרצת הערכות סטנדרטיות של שפה באנגלית מול תוצאות היסטוריות ממאמרי בסיס בתחום.

  • אימון מודלים מוקטנים

    שימוש בתצורת wikitext-2 הקטנה לבדיקת ארכיטקטורות מהירה בלי לבזבז משאבי חישוב כבדים.

איפה זה נופל

בכרטיס המקורי חסר המון מידע מתועד. אין פירוט על הטיות, אין ניתוח של מידע רגיש, ואין התייחסות רשמית לשפות חוץ מהטקסט האנגלי שמופיע בדוגמאות. המחקר המקורי פורסם עוד ב־2016, כך שהערכים ישנים יחסית ולא משקפים עובדות עדכניות. אם המטרה שלכם היא מודל שמבין עברית, המאגר הזה פשוט לא יעזור לכם.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. הדאטהסט מבוסס על ערכים נבחרים מהוויקיפדיה באנגלית. אם אתם מחפשים חומר לאימון בעברית, תצטרכו לפנות למקורות אחרים.

מה ההבדל בין גרסה זו לגרסת wikitext המקורית?

הגרסה המקורית שברה את הערכים לשורות קצרות ונפרדות. כאן איחדו את השורות כך שכל רשומה מייצגת ערך שלם, מה שמתאים יותר לאימון מודרני.

האם מותר להשתמש בו לאימון מודל מסחרי?

הרישיון הוא רישיון חופשי מסוג שיתוף זהה. מותר להשתמש במידע, אך כל יצירה נגזרת חייבת להיות מופצת תחת תנאים זהים, מה שמקשה על פיתוח מוצרים קנייניים סגורים.

כמה שטח אחסון צריך לפנות עבורו?

קבצי ההורדה שוקלים 373.28 מגה-בייט. לאחר פריסה וייצור הנתונים בזיכרון ובדיסק, נדרש שטח כולל של כ־1.45 גיגה-בייט.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בלי צורך באישור גישה או מפתח פרטי. הקבצים יושבים בפורמט Parquet, כך שהטעינה מהירה ויעילה. נפח ההורדה הכולל הוא 373.28 מגה-בייט, ובדיסק המאגר המיוצר תופס 1072.25 מגה-בייט, סך הכל סביב 1.45 גיגה-בייט לכלל הקבצים. יש רק שדה אחד ברשומה ושמו text.

from datasets import load_dataset

ds = load_dataset("EleutherAI/wikitext_document_level")

הרישיון

המאגר מופץ ברישיון cc-by-sa-3.0, אף שבגוף הכרטיס מוזכר גם CC BY-SA 4.0. הרישיון דורש מתן קרדיט וכולל סעיף שיתוף זהה שמחייב הפצה של יצירות נגזרות תחת אותו רישיון. המשמעות עבור מי שמאמן מודל מסחרי סגור עלולה להיות בעייתית, ולכן מומלץ לבדוק היטב עם ייעוץ משפטי אם תוצרי האימון נחשבים נגזרת של המידע.

הרישיון המלא ב־Hugging Face ↗