GPT
P

ParseBench

קוד פתוח

llamaindexapache-2.02026-04-09

  • document-parsing
  • pdf
  • benchmark
  • evaluation
  • tables

בנצ׳מרק להערכת חילוץ נתונים ממסמכים אמיתיים, שמחליף ציונים כלליים בבדיקה מדויקת לפי 169 אלף חוקים קונקרטיים.

  • 18,591הורדות בחודש
  • 127לייקים

מה זה

המאגר כולל 2,078 עמודים מאומתים ידנית שנלקחו מתוך 1,211 מסמכים פומביים מעולמות הביטוח, הפיננסים והממשל. כל דוגמה מיועדת לבדוק נקודות כשל ספציפיות שמכשילות סוכני בינה מלאכותית, ומחולקת לחמישה ממדים שונים: טבלאות מורכבות עם תאים ממוזגים, גרפים שדורשים חילוץ ערכים מדויקים, נאמנות לטקסט המקורי ללא הזיות או השמטות, שמירה על עיצוב בעל משמעות סמנטית כמו קו חוצה או כתב עילי, ועיגון ויזואלי של מיקומי האלמנטים בעמוד.

הבדיקה נשענת על מעל 169 אלף חוקי בדיקה בפורמט שורות JSON. תהליך התיוג שילב סימון ראשוני באמצעות מודלי ראייה מתקדמים ולאחר מכן תיקון ידני של בני אדם. החלוקה הפנימית מפרידה בין קובצי החוקים השונים לבין קובצי המקור שכוללים מסמכי PDF ותמונות סרוקות.

מתאים ל

  • הערכת מנועי OCR ומודלי ראייה

    בדיקת הדיוק של מערכות קיימות בחילוץ נתונים מורכבים ממסמכים סרוקים ודוחות כספיים.

  • בקרת שלמות לטבלאות בדוחות

    מדידת יכולת המודל לשחזר תאים ממוזגים וכותרות היררכיות בלי להחליף בין עמודות.

  • אימות חילוץ נקודות מידע מגרפים

    בחינת היכולת לחלץ ערכים מספריים מדויקים מתוך תרשימי עמודות, עוגה וקווים.

איפה זה נופל

הנתונים מתמקדים בעיקר בשפה האנגלית, ורק 47 מסמכים מוגדרים כרב לשוניים, כך שאין כאן בדיקה מעמיקה של עברית או כיווניות מימין לשמאל. המאגר מיועד אך ורק להערכה ובדיקה, ולא מכיל נפח שמספיק לאימון מודלים מאפס. בנוסף, חילוץ ערכים מגרפים מסתמך בחלקו על הערכה ויזואלית מקורבת ולא על ערך מספרי מוחלט, מה שמחייב שימוש בספי סבילות גמישים שעלולים לפספס סטיות קטנות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוצהר הוא Apache 2.0, והוא מתיר שימוש מסחרי מלא בקוד ובחוקי ההערכה. יחד עם זאת, קובצי המקור נאספו מאתרים ציבוריים שונים, ולכן יש לוודא שהתוכן הספציפי של המסמכים אינו מוגן בזכויות יוצרים מחמירות לפני שמפיצים אותם הלאה.

האם המאגר מתאים לבדיקת מסמכים בעברית?

המאגר מוגדר כדובר אנגלית ואינו מותאם לבדיקת שפות הנכתבות מימין לשמאל. קיימת בו קטגוריה רב לשונית קטנה של 47 עמודים בלבד, אך אין התחייבות לנוכחות עברית או לכיסוי הטיפול הייחודי שהיא דורשת.

איך נאספו התיוגים והחוקים שמרכיבים את הבנצ׳מרק?

האיסוף התבצע בשני שלבים מוגדרים. מודל ראייה מתקדם ביצע תיוג ראשוני אוטומטי של האלמנטים, ולאחר מכן בני אדם עברו על התוצאות, תיקנו טעויות ואימתו את הנתונים ידנית כדי ליצור את סט חוקי ההערכה הסופי.

במה המאגר הזה שונה ממאגרי OCR רגילים?

במקום למדוד דמיון טקסטואלי כללי, הוא בודק כשלים קונקרטיים לפי 169 אלף חוקים שונים בחמישה ממדים. המדדים בוחנים האם סדר הקריאה נשמר, האם עיצובים מהותיים כמו קו חוצה אבדו, והאם מבנה הטבלה שוחזר בדיוק שמתאים לסוכני עיבוד אוטומטיים.

איך טוענים

טוענים את קובצי הנתונים ישירות דרך קובצי JSONL ייעודיים לכל ממד, כמו chart.jsonl או table.jsonl, לצד תיקיית המסמכים docs שמכילה 2,113 קבצים. אין צורך באישור גישה מיוחד כדי להוריד את המאגר. כל רשומה כוללת את הנתיב למסמך המקור, מזהה ייחודי, סוג הבדיקה, תגיות קושי, ואת חוק הבדיקה או ערכי ה־HTML הצפויים. קוד ההרצה המלא נמצא במאגר הגיטהאב של הפרויקט.

from datasets import load_dataset

ds = load_dataset("llamaindex/ParseBench")

הרישיון

המאגר מופץ ברישיון Apache 2.0 שמתיר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. חובה לזכור שמסמכי המקור לוקטו מערוצים מקוונים ציבוריים, כך שרישיון הקוד אינו בהכרח מבטל זכויות יוצרים של גורמים שלישיים על תוכן המסמכים עצמם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗