GPT
R

research-papers

קוד פתוח

tegridydevרישיון לא דווח2026-01-28

  • knowledge
  • research
  • papers
  • academic
  • research-paper

מאגר מאמרים אקדמיים מסווגים לפי נושאים, המשלב קובצי PDF מקוריים לצד המרות טקסט בפורמט Markdown. הוא מתאים למי שבונה מודלים להבנת מסמכים סרוקים או סיווג טקסט מדעי.

  • 15,563הורדות בחודש
  • 19לייקים

מה זה

המאגר כולל 3,881 קבצים שמכילים מאמרים אקדמיים באנגלית. המבנה שלו מחולק לפי תחומי מחקר, למשל תיקיית NLP שמרכזת מאמרים מהשנים האחרונות לפי מזהי arXiv מוכרים. הרשומות מגיעות בשתי צורות, קובצי PDF מלאים של המאמרים, ותיקייה נפרדת של גרסאות טקסט שהומרו לפורמט Markdown.

מי שהעלה את הדאטהסט לא מפרט באילו כלים בוצע האיסוף או לפי איזה מפתח נבחרו המאמרים הספציפיים. אין כאן תיעוד של תהליך סינון ידני או חלוקה מוגדרת מראש לסט אימון ובדיקה. המבנה נשען בעיקר על שמות הקבצים והתיקיות כדי לסווג את הנושא הראשי של כל מסמך.

מתאים ל

  • אימון מודלי ראייה למסמכים

    קובצי ה־PDF מאפשרים לחלץ עמודים כתמונות ולבדוק עליהם מודלים של OCR והבנת פריסת מסמך.

  • סיווג נושאי של מאמרים

    חלוקת המאמרים לקטגוריות מאפשרת לאמן מודלים לזיהוי אוטומטי של תחומי מחקר מתוך טקסט.

  • בדיקת איכות של ממירי טקסט

    השוואה בין קובצי המקור ב־PDF לבין קובצי ה־Markdown יכולה לסייע בבדיקת מנועי חילוץ טקסט.

איפה זה נופל

הבעיה המרכזית היא איכות הטקסט בגרסאות ה־Markdown. היוצר מבהיר שמדובר בהמרה גולמית מ־PDF שלא עברה ניקוי ידני, כך שעלולים להופיע שם שיבושי OCR, תווים שבורים ואי-דיוקים במבנה. בנוסף, כל החומרים באנגלית בלבד, ואין ייצוג לעברית או למסמכים מקומיים. מי שמתכנן להשתמש בזה למערכת בפרודקשן יצטרך לעשות ולידציה עצמאית על הטקסטים ולוודא שהחלוקה לקטגוריות אכן תואמת את המציאות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. בעמוד המאגר לא דווח שום רישיון, ומדובר במאמרים אקדמיים שנאספו ממקורות חיצוניים. ללא היתר מפורש או רישיון פתוח, שימוש מסחרי עלול להפר זכויות יוצרים של החוקרים והמוציאים לאור.

האם יש במאגר תוכן בעברית?

לא. כל 3,881 הקבצים במאגר כתובים באנגלית בלבד. אם המטרה שלכם היא טיפול במסמכים מדעיים או משפטיים בעברית, הנתונים כאן לא יעזרו.

איך נאספו המאמרים והאם הם עברו בקרת איכות?

הכרטיס לא חושף את שיטת האיסוף או מקורות השליפה, אם כי שמות הקבצים מעידים על מזהי arXiv. גרסאות ה־Markdown נוצרו בתהליך אוטומטי גס, ובעל המאגר מציין מראש שהטקסט אינו מדויק במאה אחוז ודורש בדיקה.

איך טוענים

אתם יכולים למשוך את המאגר ישירות דרך ספריית datasets של Hugging Face, ואין צורך באישור גישה מיוחד. בגלל שהנתונים שמורים כקובצי PDF וטקסט, העבודה איתם דורשת התאמה ידנית. אם אתם בונים מודל ויזואלי תצטרכו להמיר את דפי ה־PDF לתמונות, ואם אתם צריכים טקסט בלבד אפשר לגשת ישירות לתיקיית text-versions.

from datasets import load_dataset

ds = load_dataset("tegridydev/research-papers")

הרישיון

המאגר פורסם ללא הגדרת רישיון כלל. המשמעות פשוטה: מבחינה חוקית אין לכם הרשאה מפורשת להשתמש בקבצים, להפיץ אותם או לאמן עליהם מודל מסחרי. המאמרים עצמם מוגנים בזכויות יוצרים של כותביהם המקוריים, וכל עוד היוצר לא ציין תנאי שימוש ברורים, כל אימון או שימוש בתוצרים האלה חושף אתכם לסיכון משפטי.

הרישיון המלא ב־Hugging Face ↗