GPT
S

ScienceMetaBench

קוד פתוח

opendatalabcc-by-4.02025-12-26

מבחן ביצועים לחילוץ מטא-דאטה מובנה מקובצי PDF מדעיים. הוא בודק מודלים על מאמרים, ספרי לימוד וספרים סרוקים בשפות שונות, בעיקר אנגלית וסינית.

  • 692הורדות בחודש
  • 117לייקים

מה זה

המאגר מכיל בדיוק 1,010 רשומות מבחן שמקושרות לקובצי PDF אמיתיים. החלוקה היא לשלוש קטגוריות: מאמרים אקדמיים עם שדות כמו מזהה דיגיטלי, מחברים ותקציר, ספרי לימוד רשמיים עם מסתב והוצאה, וספרים דיגיטליים שכוללים גם סריקות של מסמכים היסטוריים וסיווג ספריות סיני.

האיסוף נעשה בשתי פעימות נפרדות בשנת 2025. הפעימה הראשונה מאוגוסט כללה 211 רשומות בחלוקה כמעט שווה, והפעימה השנייה מאוקטובר הוסיפה עוד 799 רשומות, רובן מאמרים וספרים דיגיטליים. המקורות מכסים מגוון תחומים ותקופות, כולל טקסטים עתיקים ומבנים מורכבים של עמודי שער וזכויות יוצרים.

מתאים ל

  • בדיקת מודלי ראייה-שפה

    מדידת הדיוק של מודלים בהמרת עמודי שער וזכויות יוצרים של קובצי PDF לשדות מובנים.

  • הערכת צינורות OCR

    בחינת יכולת של מערכות פענוח מסמכים לחלץ נתונים כמו מזהה דיגיטלי ומסתב מספרים ישנים.

  • מדד השוואתי למודלים

    הרצת סקריפט ההשוואה המובנה כדי למדוד ביצועים יחסיים בין מודלי שפה שונים בארגון.

איפה זה נופל

המאגר קטן מדי לאימון רציני ומיועד כמעט לחלוטין לבדיקה והערכה של מערכות קיימות. השפות הראשיות המוגדרות במטא-דאטה הן אנגלית וסינית, ואין בו ייצוג לעברית, כך שלא תוכלו לבדוק עליו מסמכים מקומיים. בנוסף, חילוץ מספרי לימוד בפעימה השנייה דל מאוד וכולל רק 46 דוגמאות, ושיטת הציון מבוססת על השוואת מחרוזות יבשה שלא מבינה ניסוחים חלופיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא קוד פתוח מתירני מסוג CC-BY-4.0 שמאפשר שימוש מסחרי מלא. כל מה שנדרש לפי הרישיון הוא לתת קרדיט נאות לצוות שיצר אותו.

האם יש בדאטהסט תמיכה במסמכים בעברית?

לא. המאגר מסומן רשמית עבור אנגלית וסינית, עם נוכחות של שפות כמו גרמנית ויוונית, אך אין בו מסמכים בעברית ולא ניתן לבחון עליו ביצועים לחומר מקומי.

האם הנתונים מתאימים לאימון מודל מאפס?

המאגר קטן מדי לאימון בסיס ומכיל בסך הכל 1,010 רשומות שלמות. המטרה העיקרית שלו היא מבחן ביצועים ומדידת דיוק של מודלים קיימים, או לכל היותר פיין-טיונינג ממוקד מאוד.

איך מודדים אם המודל שלי הצליח במשימה?

המאגר מספק סקריפט פייתון שמשווה את הפלט של המודל לערכי האמת בעזרת דמיון מחרוזות. הסקריפט מחשב ציון לכל שדה בנפרד וציון ממוצע כולל, ומוציא קובץ אקסל מפורט.

איך טוענים

אין צורך בבקשת גישה מיוחדת, מורידים ישירות דרך האגינג פייס. קובצי המטא-דאטה מגיעים בפורמט JSONL פשוט לפי תאריכי הפעימות, כשכל שורה מכילה ערך גיבוב שמפנה לשם קובץ ה־PDF המקורי בתיקייה הייעודית. המאגר כולל סקריפט פייתון להשוואת טקסט שמסתמך על ספריות פנדס ופתוח ישירות לייצוא דוחות לאקסל.

from datasets import load_dataset

ds = load_dataset("opendatalab/ScienceMetaBench")

הרישיון

הרישיון הוא CC-BY-4.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולבנות עליו מוצרים או להעריך מודלים פנימיים של החברה. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים המקוריים, ואין חובה לפרסם פיתוחים עתידיים תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗