GPT
S

Sci-Base

קוד פתוח

opendatalabcc-by-4.02026-03-24

  • chem
  • bio
  • climate
  • medical
  • material

מאגר ענק של מעל עשרים וחמישה מיליון מסמכים מדעיים סרוקים שעברו פענוח עמוק. מתאים למי שרוצה לאמן מודל שפה על מתמטיקה, כימיה ומדעי החיים בלי להסתבך עם סריקת PDF גולמית.

  • 1,738הורדות בחודש
  • 38לייקים

מה זה

המאגר מכיל מעל עשרים וחמישה מיליון מסמכים מדעיים בגישה חופשית, כולל מאמרים ופרקי ספרים, שמסתכמים ביותר משש מאות מיליארד טוקנים מעובדים. החומר מקיף עשרה תחומי ליבה: מתמטיקה ומדעי המחשב, פיזיקה, כימיה, מדעי החיים, מדעי כדור הארץ והאטמוספירה, אסטרונומיה, רפואה, הנדסת חומרים, אנרגיה, והנדסה ותעשייה. מדובר בחלק אחד מתוך תשתית רחבה יותר שכוללת גם שכבות התאמה והסקה מדעית.

כל רשומה מייצגת מסמך בודד במבנה מובנה. הרשומה כוללת מזהה מסמך, כותרת, רשימת מחברים, תחום מדעי, תאריך פרסום, טקסט מפוענח, ומטא דאטה שמכיל רישיון מקור, קישור למקור ומספר ישויות מדעיות. התוכן עבר עיבוד עמוק בעזרת מנוע בשם MinerU, שנועד לחלץ נוסחאות מתמטיות, משוואות כימיות, טבלאות ומיקומי תרשימים, במטרה לשמור על סדר הקריאה והמבנה הלוגי המקורי של המאמרים ולא להסתפק בטקסט שטוח.

מתאים ל

  • אימון מקדים למודל שפה מדעי

    הזנת שש מאות מיליארד טוקנים של טקסט מדעי עשיר בנוסחאות ללימוד מושגים מורכבים.

  • חילוץ ישויות וקשרים כימיים

    זיהוי חומרים, תגובות ומבנים מתוך טקסטים מפוענחים שכוללים ייצוגי נוסחאות.

  • בניית מערכות שליפה למחקר

    שימוש במאגר כבסיס ידע לחיפוש סמנטי ושליפת מסמכים לפי תחומים מוגדרים.

איפה זה נופל

כל הנתונים באנגלית בלבד, ואין כאן מקורות בעברית או תמיכה ביישור שפות אחרות. נקודת החיתוך של החומר מגיעה עד מרץ 2026, כך שמחקרים מאוחרים יותר חסרים. מעבר לזה, למרות הפיענוח המתקדם של נוסחאות ותרשימים, פענוח אוטומטי של קובצי PDF עדיין מועד לטעויות קריאה, שבירת טבלאות מורכבות והשמטת תווים במשוואות צפופות. כדאי לדגום ולבדוק את איכות הפלט בתחום שלכם לפני שמתחילים ריצה יקרה.

שאלות
נפוצות

האם מותר להשתמש במאגר לאימון מודל מסחרי?

הרישיון של המאגר עצמו מתיר שימוש מסחרי עם מתן קרדיט, אבל המאמרים עצמם מגיעים ממקורות שונים. חלקם פורסמו תחת רישיונות שאוסרים שימוש מסחרי. תצטרכו לסנן את הנתונים לפי שדה הרישיון שבמטא דאטה של כל מסמך.

האם יש במאגר תוכן בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד, מתוך ספרות מחקרית בינלאומית.

באיזה פורמט המידע מגיע ואיך מורידים אותו?

הטקסטים מגיעים במבנה ג'ייסון שכולל טקסט מפוענח ומטא דאטה, לצד קובצי ארכיון של תמונות ותרשימים. אפשר לטעון אותו ישירות דרך ספריית datasets בפייתון, כולל אפשרות למשוך רק תת תחום מסוים כדי לחסוך מקום.

מה מייחד את המאגר הזה לעומת סריקות רגילות של מאמרים?

המסמכים עובדו במנוע פיענוח ייעודי שמשמר נוסחאות מתמטיות, משוואות ותרשימים במקום להפוך אותם לטקסט שבור. זה נותן קלט נקי ומובנה שמתאים ישירות למודלי שפה.

איך טוענים

טוענים את המאגר דרך ספריית datasets בפייתון, ישירות לפי שם המאגר או בחלוקה לתתי תחומים כמו מדעי החיים. המאגר עצום ומכיל כאלף וחמש מאות קבצים, כולל ארכיוני תמונות בפורמט tar, כך שהורדה מלאה דורשת נפח אחסון כבד במיוחד ורוחב פס רציני. אין צורך בבקשת גישה מיוחדת.

from datasets import load_dataset

ds = load_dataset("opendatalab/Sci-Base")

הרישיון

המבנה, המטא דאטה והעיבוד מופצים תחת רישיון cc-by-4.0 שדורש ייחוס ומאפשר עבודה מסחרית. עם זאת, התוכן המקורי של המאמרים עצמם כפוף לרישיונות הגישה החופשית המקוריים שלהם, שכוללים לעיתים הגבלות לשימוש לא מסחרי. לפני אימון מודל מסחרי חובה לסנן את הרשומות לפי שדה הרישיון במטא דאטה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗