GPT
A

arxiv-latex

קוד פתוח

scholarweaveother2026-06-18

  • science
  • arxiv
  • latex
  • academic

המאגר מרכז מעל שלושה מיליון מאמרים מ־arXiv כשהטקסט בפורמט LaTeX מוצמד ישירות למטא-דאטה. הוא חוסך תשלום חשבונות תעבורה ל־AWS ועיבוד ידני של קובצי ארכיון דחוסים.

  • 22,940הורדות בחודש
  • 144לייקים

מה זה

כל רשומה מייצגת מאמר אקדמי בודד וכוללת פרטים מזהים מלאים: כותרת, תקציר, שמות מחברים מפורקים, קטגוריות, מזהה DOI, היסטוריית גרסאות ורישיון המאמר. גולת הכותרת היא עמודת ה־latex, שמאגדת את כל קובצי המקור של המאמר, כולל קובצי tex, ביבליוגרפיה ועיצוב, לתוך מחרוזת טקסט אחת במבנה היררכי קריא.

המקור מגיע ממאגר ה־S3 הציבורי של arXiv. היוצר מעבד את המידע בתוך אזור צפון וירג'יניה ב־AWS כדי לעקוף עלויות תעבורה, מחלץ את ארכיוני ה־tar וה־gz, מצליב אותם עם קובצי המטא-דאטה, ומייצא הכל לקובצי Parquet מחולקים. העדכון מתבצע אחת לחודש, בהתאם לקצב שבו arXiv משחררת עדכונים למאגרים שלה.

מתאים ל

  • אימון מודלים להבנת LaTeX

    אימון מודלי שפה על תחביר LaTeX וכתיבה מתמטית עשירה מתוך מיליוני מאמרים אמיתיים.

  • חילוץ תכונות ומיון מאמרים

    בניית סיווג אוטומטי של מחקרים לפי קטגוריות ותקצירים מובנים מראש.

  • בניית מנועי חיפוש אקדמיים

    אינדוקס טקסט מלא של גוף המאמרים לצד המטא-דאטה והמחברים לצורכי אחזור מידע.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים לחלוטין על ספרות מדעית ואקדמית. אין כאן שום ייצוג לעברית, לטקסט יומיומי או לשפות תכנות שאינן מתועדות במאמרים. בנוסף, לא כל מאמר מותר לשימוש חופשי, והרישיונות משתנים בצורה קיצונית בין רשומות, כך שחובה לסנן את עמודת הרישיון לפני שמזינים טקסט למודל מסחרי. המאגר מציג את קוד ה־LaTeX המקורי כמו שהוגש, ולכן תיתקל במבנים מורכבים, פקודות מאקרו מותאמות אישית וחוסר אחידות סגנוני שדורשים סינון נוסף.

שאלות
נפוצות

האם מותר להשתמש במאגר כדי לאמן מודל מסחרי?

לא באופן גורף. זכויות היוצרים שייכות למחברי המאמרים, וכל רשומה כוללת שדה רישיון נפרד. חובה לבצע סינון לפי שדה הרישיון ולבחור רק מאמרים שפורסמו תחת רישיון שמתיר שימוש מסחרי מפורש.

האם יש במאגר טקסטים בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל המאמרים שנאספו מ־arXiv כתובים באנגלית.

איך המאגר נאסף בהשוואה להורדה ישירה מ־arXiv?

ההורדה הרגילה מ־arXiv מתבצעת מ־S3 במודל שבו המוריד משלם על התעבורה, בעלות של כ־450 דולר לכל הקורפוס. המפתח מוריד את המידע בתוך אותה רשת ענן, מחלץ את קובצי ה־tar וה־gz, מחבר את קוד המקור למטא-דאטה ומעלה אותו בפורמט Parquet מוכן לשליפה.

איך עוקבים אחרי עדכונים וקבצים ספציפיים?

במאגר קיים קובץ מניפסט XML שמכיל רשימה של כל חלקי ה־Parquet. הוא כולל חותמות זמן, גודל, סיכומי ביקורת וטווחי מזהים של המאמרים בכל קובץ, מה שמאפשר להוריד רק עדכונים חודשיים חדשים.

איך טוענים

המידע מחולק לעשרות קובצי Parquet שניתן לטעון ישירות באמצעות ספריות תואמות. לצורך ניהול והורדה מבוקרת, קיים קובץ מניפסט בפורמט XML שמפרט את הגודל, סכומי הביקורת MD5 וטווחי המזהים של כל קובץ. אין צורך באישור גישה כדי להוריד. השדות המרכזיים לעבודה הם latex שמכיל את תוכן המקור, abstract, categories לחלוקה לפי תחומים, ו־license שקריטי לבדיקת תנאי השימוש ברמת המאמר הבודד.

from datasets import load_dataset

ds = load_dataset("scholarweave/arxiv-latex")

הרישיון

הרישיון של המאגר מוגדר כ־other. המאגר משמש כמראה לתכנים מ־arXiv, וזכויות היוצרים על כל מאמר שייכות למחברים המקוריים שלו. אי אפשר להשתמש במאגר כמקשה אחת לצרכים מסחריים בלי לבדוק את עמודת הרישיון בכל שורה בנפרד. חלק מהמאמרים שוחררו תחת רישיונות פתוחים כמו Creative Commons וחלקם תחת זכויות יוצרים מוגבלות.

הרישיון המלא ב־Hugging Face ↗