GPT
G

goodwiki

קוד פתוח

euirimmit2023-09-09

טקסט נקי מתוך עשרות אלפי ערכים מובחרים מוויקיפדיה באנגלית, ששומר על מבנה מרקדאון של נוסחאות, קוד ורשימות. זה פתרון למי שצריך חומר אימון איכותי בלי הרעש הרגיל של ויקיטקסט.

  • 244הורדות בחודש
  • 55לייקים

מה זה

המאגר מכיל 44,754 ערכים מוויקיפדיה האנגלית שהוגדרו על ידי העורכים כערכים טובים או מובחרים. הנתונים נאספו ב־4 בספטמבר 2023 דרך ממשק ה־API של ויקיפדיה, עברו פריסה של תבניות נבחרות, והומרו לפורמט מרקדאון של גיטהאב באמצעות כלי ההמרה פאנדוק. בניגוד למאגרי ויקיפדיה גולמיים, תהליך העיבוד הסיר הערות שוליים, קבצים, תיבות מידע וטבלאות, אבל שמר על נוסחאות מתמטיות, בלוקים של קוד ורשימות מסודרות.

כל שורה כוללת את מזהה העמוד, כותרת הערך, מזהה הגרסה הספציפית, תיאור קצר שנכתב על ידי עורכים, רשימת קטגוריות, ואת גוף הערך במרקדאון. בסך הכל הטקסט מכיל כ־179 מיליון טוקנים לפי הטוקנייזר של המודל opt-350m, ועיצוב המרקדאון נוקה מהדגשות וקו תחתון כדי למנוע רעשים בתוכן טכני.

מתאים ל

  • אימון מקדים למודלי שפה

    אימון מודלים על טקסט עשיר במבנה שכולל משוואות מתמטיות ובלוקי קוד במרקדאון תקני.

  • אימון מודלים למשימות תמצות

    שימוש בטקסט המלא מול שדה התיאור הקצר שנכתב בידי עורכים כמטרה לתמצות.

  • כוונון להוראות טכניות

    לימוד מעקב אחר פורמט מרקדאון נקי שמכיל רשימות, ציטוטים וסימון מתמטי מסודר.

איפה זה נופל

החומר מוגבל לאנגלית בלבד, חוץ מקטעים קצרים או סימני תעתיק פונטי, והוא מעודכן לספטמבר 2023. בגלל הסרת טבלאות ותיבות מידע יש ערכים שמכילים כותרות של סעיפים ריקים. בנוסף, חסרים נתוני אינפלציה שהסתמכו על תבניות ספציפיות, שמות ספרים מסוימים נמחקו כי סווגו בטעות כמראי מקום, וישנן בעיות עימוד במשוואות כימיות נדירות. ערכים על שפות ותרבויות עתיקות מכילים לעיתים תווי יוניקוד חריגים שמחייבים סינון לפני טוקניזציה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המאגר מופץ תחת רישיון MIT שמאפשר שימוש מסחרי חופשי לחלוטין. התנאי היחיד הוא שמירת הצהרת הרישיון והקרדיט למחבר המקורי.

האם המאגר כולל תוכן בעברית?

לא. הטקסטים מגיעים אך ורק מוויקיפדיה באנגלית. לעיתים נדירות מופיעים ביטויים קצרים בשפות זרות או תעתיק פונטי בתוך הטקסט האנגלי.

כמה שטח אחסון צריך כדי להוריד אותו?

הקובץ שוקל 482.7 מגה בייט כקובץ Parquet דחוס. לאחר פריסה לקריאה בזיכרון מדובר בטקסט שמכיל כ־132 מיליון מילים.

מה ההבדל בינו לבין WikiText-103?

הוא גדול פי 1.5 ממנו מבחינת מספר הטוקנים ומעודכן לשנת 2023. בנוסף, הוא שומר על מבנה מרקדאון של נוסחאות, קוד ורשימות, במקום לפרק אותם לטקסט גולמי ומקוטע.

איך טוענים

המאגר מגיע כקובץ Parquet בודד במשקל 482.7 מגה בייט עם דחיסת snappy, ואין צורך בבקשת גישה או אישור מיוחד כדי להוריד אותו. הטעינה נעשית ישירות דרך ספריית datasets באמצעות המזהה euirim/goodwiki. השדה המרכזי לאימון הוא markdown שמחזיק את הטקסט המלא, ושדה ה־description מתאים למשימות תמצות.

from datasets import load_dataset

ds = load_dataset("euirim/goodwiki")

הרישיון

המאגר וקוד המקור שלו מפורסמים תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי והפצה, ומחייב רק שמירה על הודעת זכויות היוצרים והרישיון המקורי. הוא לא כופה שיתוף באותו רישיון, ומאפשר לאמן מודלים סגורים או מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗