GPT
O

open-web-math

קוד פתוח

open-web-mathרישיון לא דווח2023-09-06

המאגר מרכז טקסט מתמטי איכותי מהרשת עם חילוץ קפדני של נוסחאות LaTeX. הוא נועד למי שמאמן מודלים וצריך חומר לימוד מתמטי מבוסס מקורות רשת ולא רק מאמרים אקדמיים.

  • 31,560הורדות בחודש
  • 359לייקים

מה זה

הנתונים כוללים 6.3 מיליון מסמכים ובהם 14.7 מיליארד טוקנים שנאספו מתוך מעל 200 מיליארד דפי אינטרנט בארכיון Common Crawl. כל רשומה מייצגת עמוד רשת ומכילה את הטקסט המלא שחולץ ממנו, כתובת המקור, תאריך הסריקה ושדה מטא-דאטה עם פרטים על תהליך החילוץ.

המקורות מגיעים מיותר מ־130 אלף דומיינים שונים, בעיקר פורומים, אתרי בלוגים ודפי לימוד. האתרים המובילים בנפח התווים הם stackexchange.com, nature.com, wordpress.com ו־physicsforums.com. הסינון כלל הסרת תבניות עיצוב ואתרים לא רלוונטיים, זיהוי שפה כדי לשמור רק אנגלית, שימוש במודל KenLM לאיכות טקסט, ומודל MathScore ייעודי לזיהוי תוכן מתמטי, לצד ניקוי כפילויות באמצעות SimHash ובדיקה ידנית.

מתאים ל

  • אימון מקדים של מודלים

    הזנת מיליארדי טוקנים מתמטיים מבוססי נוסחאות LaTeX אל מודלי שפה כדי לשפר את יכולות החישוב וההיגיון שלהם.

  • כוונון עדין למתמטיקה

    שיפור ביצועים של מודלים קיימים בפתרון בעיות מתמטיות, פיזיקליות ומדעי המחשב מתוך נתוני פורומים ודיונים.

  • מחקר על חילוץ נוסחאות

    בחינת איכות הטקסט והמבנה של סימני LaTeX שחולצו מדפי אינטרנט מורכבים ברחבי הרשת.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, כך שאין בו מקורות בעברית או בשפות אחרות. הסינון מבוסס על סריקות עבר של Common Crawl, כך שמידע עדכני מאוד אינו נכלל בו. בנוסף, חילוץ אוטומטי של נוסחאות מתוך דפי HTML עלול להכיל שגיאות תחביר נקודתיות ב־LaTeX, וחלק ניכר מהתוכן נשען על אתרי שאלות ותשובות ובלוגים שרמת הדיוק המתמטית בהם אינה מבוקרת כמו במאמר שעבר ביקורת עמיתים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

בטקסט הכרטיס מצוין רישיון ODC-By 1.0 שמאפשר שימוש תחת מתן ייחוס, אך שדה הרישיון הרשמי בעמוד אינו מוגדר. בנוסף, היוצרים מבהירים כי לא שינו את הרישיונות המקוריים של האתרים הנסרקים וכי יש לציית לתנאי Common Crawl, עובדה שיוצרת סיכון משפטי הדורש בדיקה מול ייעוץ משפטי לפני שימוש מסחרי.

האם המאגר כולל טקסטים ומתמטיקה בעברית?

לא, המאגר אינו כולל תוכן בעברית. אחד משלבי הסינון המרכזיים שביצעו המפתחים כלל מודל זיהוי שפה של FastText, שבאמצעותו נשמרו אך ורק מסמכים באנגלית.

איך המידע נאסף וסונן מתוך הרשת?

החוקרים סיננו מעל 200 מיליארד דפי HTML מתוך Common Crawl באמצעות תהליך רב-שלבי. התהליך כלל חילוץ נוסחאות LaTeX, ניפוי דפים שאינם באנגלית, סינון איכות בעזרת KenLM ומודל MathScore ייעודי, הסרת כפילויות באמצעות SimHash ובדיקה ידנית מדגמית של התוצאות.

במה המאגר שונה מאוספי טקסט כלליים מהרשת?

רוב מאגרי הרשת הכלליים מנקים תגיות HTML ומשמיטים או משבשים נוסחאות מתמטיות מורכבות. כאן הושם דגש מיוחד על שימור תחביר LaTeX ועל סינון מדויק של דיונים ומסמכים מתמטיים מתוך מעל 130 אלף דומיינים שונים.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets בפייתון בעזרת הפקודה load_dataset עם המזהה הרשמי. המאגר פתוח לציבור ואינו דורש אישור גישה מוקדם או מפתח. המידע מחולק ל־114 קובצי Parquet שמכילים שדות קבועים של טקסט, קישור, תאריך סריקה ומטא-דאטה טכנית, כך שרצוי לתכנן מראש את אופן הקריאה והאחסון המקומי של כל החלקים.

from datasets import load_dataset

ds = load_dataset("open-web-math/open-web-math")

הרישיון

בכרטיס המאגר לא הוגדר רישיון רשמי בשדות המטא-דאטה של העמוד, אך בטקסט עצמו המפתחים מציינים רישיון ODC-By 1.0 לצד כפיפות לתנאי השימוש של Common Crawl. הרישיון הזה דורש מתן קרדיט וייחוס, אך היוצרים מדגישים שהם לא שינו את הרישיונות המקוריים של דפי הרשת שנאספו, מה שמותיר אי-ודאות משפטית לגבי שימוש מסחרי במודל שאומן עליהם.

הרישיון המלא ב־Hugging Face ↗