GPT
E

ExtractBench

קוד פתוח

llamaindexapache-2.02026-08-06

  • document-extraction
  • structured-extraction
  • information-extraction
  • pdf
  • benchmark

מאגר לבדיקת חילוץ מידע מובנה ממסמכים עסקיים לפי סכמות מוגדרות מראש. הוא מיועד למדידת דיוק מודלים בחילוץ שדות, טבלאות ארוכות וציטוט מיקומים מדויקים בדף.

  • 19,509הורדות בחודש
  • 30לייקים

מה זה

המאגר מכיל 370 מסמכים שמקיפים 4,869 עמודים ומחולקים לשמונה תחומים עסקיים, בהם פיננסים, אנרגיה, רכש ממשלתי, בריאות ומשפטים. מתוך כלל המסמכים, 325 הם מסמכים אמיתיים ממקורות ציבוריים כמו רשות ניירות הערך האמריקאית או רשויות מקומיות, ו־45 נבנו באופן סינתטי על בסיס מבנים קיימים כדי לבדוק רשימות ארוכות במיוחד. הקבצים כוללים מסמכים דיגיטליים מקוריים לצד 134 קבצים סרוקים, 55 קבצים עם כתב יד ו־38 מסמכים שעברו פגיעה מכוונת באיכות הסריקה כדי לבדוק עמידות לרעש ויזואלי.

המבנה מחולק לשלושה חלקים לפי אורך המסמך: קצר שכולל 252 מקרים של עד 10 עמודים, בינוני עם 98 מקרים בני 11 עד 50 עמודים, וארוך שכולל 20 מקרים של מעל 50 עמודים. כל רשומה כוללת את קובץ המקור בפורמט PDF, סכמת יעד בפורמט JSON, את הפלט המצופה, וכללי בדיקה פרטניים שמגדירים מתי שדה נחשב נכון, כולל תיחום מיקום ויזואלי בתוך העמוד.

מתאים ל

  • מדידת מודלי שפה במסמכים

    בדיקת יכולת המודל לחלץ שדות מדויקים מתוך קובצי PDF לפי סכמת יעד קשיחה.

  • הערכת עמידות לסריקות פגומות

    השוואת ביצועי חילוץ בין מסמכים דיגיטליים נקיים לגרסאות סרוקות ומטושטשות.

  • אימות מקור למידע מחולץ

    בדיקה אם המערכת מסוגלת לספק את מספר העמוד ותיבת המיקום הנכונים עבור כל ערך.

איפה זה נופל

המאגר כולו באנגלית ומבוסס על רגולציה ומסמכים אמריקאיים, כך שאינו מתאים ישירות לבדיקת מסמכים בעברית או תבניות ישראליות. מספר הדוגמאות הכולל קטן יחסית, 370 מסמכים בלבד, והוא משמש כמבחן ביצועים ולא כחומר לאימון מודלים רחב. החלק של מסמכים ארוכים מכיל 20 פריטים בלבד, עובדה שמגבילה את התוקף הסטטיסטי בקטגוריה הזו. בנוסף, בדיקת מיקום מבוססת תיבות נשענת על נתונים אנושיים שאומתו רק בחלק מהמסמכים.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי מלא ללא תשלום. מותר להריץ עליו מערכות עסקיות ולבדוק מוצרים פנימיים. חובה רק לשמור על הודעת זכויות היוצרים והייחוס ליוצרים המקוריים.

האם יש במאגר תמיכה במסמכים בעברית?

לא, כל המסמכים במאגר מוגדרים תחת השפה האנגלית בלבד. התכנים מבוססים על טפסים עסקיים וממשלתיים מארצות הברית. כדי לבדוק ביצועים בעברית תצטרכו להרכיב מערך נתונים מקומי.

איך נאספו המסמכים שנמצאים במאגר?

רוב הקבצים, 325 מתוכם, לוקטו ממקורות ציבוריים פתוחים כמו דוחות פיננסיים, מסמכי רכש ממשלתי ורישומי בתי משפט. מטא-דאטה מזהה הוסר מכל קובצי ה־PDF. 45 מסמכים נוספים נבנו בצורה סינתטית כדי לבחון טבלאות ארוכות במיוחד.

האם המאגר מתאים לאימון מודל מחדש?

המאגר מיועד לבדיקה והערכה ולא לאימון בסיסי, מכיוון שהוא כולל 370 מסמכים בלבד. הכמות הזו מספקת מבחן השוואתי מדויק לפי סכמות קבועות, אך היא קטנה מדי לאימון מודל חילוץ מאפס.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות פנייה למזהה המאגר ולחלוקה הרצויה, למשל החלק הקצר. הגישה פתוחה ואינה דורשת אישור מוקדם. השדות החשובים ברשומה, כמו סכמת המידע, התוצאה הצפויה וכללי ההשוואה, מאוחסנים כמחרוזות מקודדות ויש לפענח אותם בעזרת ספריית json. בשל גודל השדות ברשימות הארוכות, קובץ כללי ההשוואה יכול להגיע לנפח של 21 מגה בייט למסמך בודד. הרצת בדיקה מלאה מול הקבצים דורשת להוריד גם את תיקיית מסמכי המקור ולהשתמש בכלי ההרצה ממאגר הקוד הנלווה.

from datasets import load_dataset

ds = load_dataset("llamaindex/ExtractBench")

הרישיון

הנתונים והקוד מפורסמים תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ומחייב הצגת ייחוס ליוצרים וציון תנאי הרישיון המקוריים. אין דרישה לשתף תוצרי פיתוח או קוד תחת אותו רישיון, ומותר לאמן על המאגר מודלים מסחריים או להשתמש בו להערכת מערכות פנימיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗