GPT
D

dp-bench

קוד פתוח

upstagemit2024-10-08

  • nlp
  • Image-to-Text

המאגר מרכז 200 מסמכי PDF עם תיוג מבני מפורט להערכת מנועי חילוץ מידע. הוא מתאים למי שבונה צנרת RAG ורוצה לבדוק דיוק בסדר קריאה ובמבנה טבלאות מורכב.

  • 4,361הורדות בחודש
  • 85לייקים

מה זה

המאגר כולל 200 דגימות מסמכים שמגיעות משלושה מקורות: 90 מספרית הקונגרס, 90 ממאגרי חינוך פתוחים ו־20 מסמכים פנימיים של חברת Upstage. התוכן מכסה מגוון תחומים אקדמיים ומקצועיים, בהם מדעי החברה, מדעי הטבע, טכנולוגיה ומדעי המידע.

כל רשומה מיוצגת בקובץ JSON לצד קובץ ה־PDF המקורי. המידע מחולק ל־12 קטגוריות מבנה שונות כמו פסקאות, כותרות ראשיות, כותרות תחתונות, נוסחאות, איורים וטבלאות. לכל אלמנט מוצמדים מזהה ייחודי, מספר עמוד וקואורדינטות מיקום בעמוד. שדה התוכן מציג טקסט פשוט, ייצוג Markdown או קוד HTML ו־LaTeX עבור טבלאות ומשוואות.

מתאים ל

  • הערכת מנועי פיענוח

    בדיקת איכות החילוץ של כלי OCR ומנועי פרסור מול קובץ התיוג המקורי.

  • מדידת דיוק טבלאות

    חישוב מדדי TEDS למדידת רמת הדיוק של שחזור תאי טבלה ומבנה העמודות ב־HTML.

  • בדיקת סדר קריאה ב־RAG

    הערכת יכולת המודל לסדר פסקאות ואלמנטים ברצף הגיוני לצורך בניית צ'אנקים מדויקים.

איפה זה נופל

הבעיה המרכזית היא הגודל הקטן. עם 200 מסמכים בלבד, 55 טבלאות ו־10 אינדקסים, המאגר מתאים לבנצ'מרק מהיר אבל לא לאימון מודלים רחב. בנוסף, חלוקת הכותרות מוגבלת רק לרמת Heading1, ללא הבחנה בין רמות היררכיה פנימיות של כותרות משנה במסמך.

המסמכים מגיעים ממקורות אמריקאיים ומוסדיים בשפה האנגלית. אין כאן ייצוג לעברית, לטקסט מימין לשמאל או לדוחות תאגידיים מקומיים, כך שמודל שיצטיין כאן עדיין יכול לקרוס על מסמך ישראלי טיפוסי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח כלי מסחרי?

כן, הרישיון המוגדר הוא MIT שמאפשר שימוש מסחרי מלא ללא תשלום. אתם נדרשים רק לכלול את הצהרת זכויות היוצרים של המפתחים המקוריים בכל עותק או חלק מהותי מהקוד. המודלים שאתם בונים או בודקים בעזרתו נשארים בבעלותכם המלאה.

האם המאגר כולל תמיכה במסמכים בעברית?

לא, הנתונים נאספו מספרית הקונגרס, מקורות חינוך פתוחים ומסמכים פנימיים באנגלית בלבד. אין במאגר טקסטים בעברית או תמיכה באתגרים של שפות הנכתבות מימין לשמאל. כדי לבדוק ביצועים על מסמכים מקומיים תצטרכו להרכיב סט נתונים ייעודי משלכם.

איך מורידים את הקבצים וכמה מקום צריך בשבילם?

מורידים את המאגר באמצעות שכפול הריפוסיטורי עם Git, תוך שימוש ב־Git LFS עבור קובצי ה־PDF. המאגר מכיל בסך הכל 227 קבצים, מתוכם 200 מסמכים, כך שמדובר בנפח אחסון קטן מאוד שאינו דורש משאבי תשתית חריגים. לאחר השכפול כל המידע זמין מקומית ללא תלות ברשת.

מה הופך את הבנצ'מרק הזה לשונה ממאגרי טקסט רגילים?

המאגר אינו בודק רק זיהוי תווים פשוט, אלא מתמקד בקשר שבין מבנה העמוד לתוכן. הוא כולל תיוג של 12 סוגי אלמנטים ומודד בנפרד את סדר הקריאה ואת המבנה ההיררכי של טבלאות. זה מאפשר להבין בדיוק היכן המפענח נכשל לפני שמעבירים את הטקסט למודל שפה.

איך טוענים

טוענים את הנתונים ישירות מחשבון הגיטהאב או מ־Hugging Face בעזרת git clone רגיל, כאשר חובה לוודא שמותקן אצלכם כלי Git LFS לטיפול בקבצים הבינאריים. אין צורך לבקש אישור גישה מיוחד כדי להוריד את 227 הקבצים שבמאגר.

הקוד המצורף דורש התקנת תלויות דרך קובץ ה־requirements ומציע סקריפט הערכה מוכן בשם evaluate.py. הסקריפט משווה בין קובץ הניבוי שלכם לקובץ ה־reference.json ומחשב ציוני NID לסדר קריאה או מדדי TEDS למבנה הטבלאות.

from datasets import load_dataset

ds = load_dataset("upstage/dp-bench")

הרישיון

המאגר מופץ תחת רישיון MIT המתיר שימוש מסחרי ומחקרי חופשי, כולל שינוי, הפצה והטמעה במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי. מודל שאומן או נבדק על המאגר אינו מחויב בשיתוף הקוד או המשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗