GPT
G

GDP.pdf

קוד פתוח

surgeaimit2026-04-14

  • benchmark
  • pdf-parsing
  • document-understanding
  • evaluation
  • not-for-training

בנצ׳מרק הערכה של מאה מסמכי PDF מורכבים מעשרה תחומים מקצועיים. המטרה היא לבדוק הסקה מולטימודלית על דוחות וחוזים אמיתיים שרוב המודלים נכשלים בהם.

  • 44,993הורדות בחודש
  • 18לייקים

מה זה

המאגר כולל בדיוק מאה רשומות, כאשר כל רשומה מצמידה קובץ PDF אמיתי לשאלה ממוקדת ולשורת קריטריונים מפורטת לבדיקת התשובה. המסמכים נלקחו ישירות מסביבות עבודה מקצועיות בעשרה תחומים: פיננסים, רפואה, משפטים, מדע ומחקר, הנדסה, בנייה, ייצור ושרשרת אספקה, ביטוח, נדל"ן ומשאבי אנוש. אנשי מקצוע מאותם תחומים, כמו רופאים ועורכי דין, ניסחו את השאלות ובנו 184 קריטריוני הערכה שמטרתם לבחון הבנה עמוקה ולא שליפה שטחית.

המבנה מכיל פיצול יחיד של מבחן ללא חלוקת אימון. המידע בטבלה פורס את נתיב הקובץ, השאלה, התחום, ועשרות עמודות רובריקה שמפרקות כל קריטריון לסוג, חומרה, סובייקטיביות ואופן הכשל הצפוי.

מתאים ל

  • בנצ׳מרק למודלי ראייה

    מדידת יכולת של מודלים מולטימודליים לחלץ נתונים מטבלאות ודוחות סבוכים.

  • בדיקת הסקה משפטית

    בחינת יכולת המודל לאתר סעיפי שיפוי וחוזי מורכבים בתוך נספחים מרובי עמודים.

  • ולידציה של מערכות RAG

    הערכת צינורות שליפה ועיבוד מסמכים מול קריטריוני בדיקה מקצועיים.

איפה זה נופל

זהו מאגר זעיר של מאה דוגמאות בלבד, כך שהוא לא מתאים לאימון או להסקה סטטיסטית רחבה. הנתונים מתמקדים באנגלית ובעולם העסקי והמשפטי הכללי, ללא ייצוג לעברית או לרגולציה מקומית. בנוסף, חל איסור מוחלט להשתמש בחומרים לאימון, לכוונון עדין או לזיקוק מודלים כדי לא לזהם את הבנצ'מרק, והיוצרים אף הטמיעו מחרוזת canary כדי לאתר חריגות כאלה.

שאלות
נפוצות

האם מותר לאמן מודל על הדאטהסט הזה?

לא. למרות רישיון ה־MIT, יוצרי המאגר הגדירו אותו כבנצ'מרק סגור לבדיקה בלבד. שימוש בו לאימון, כוונון עדין או זיקוק נחשב זיהום של המבחן ונוגד את ייעודו.

האם המסמכים כוללים עברית?

לא, המסמכים והשאלות מבוססים על השפה האנגלית ומגיעים מתחומי מקצוע באנגלית. מי שמחפש להעריך ביצועים על מסמכים בעברית יצטרך לבנות סט נתונים ייעודי.

מה הגודל של המאגר ואיך מקבלים את הקבצים?

הטבלה כוללת מאה שורות בלבד בקובץ parquet, לצד 100 קובצי PDF השמורים בתיקייה נפרדת במאגר באמצעות Git LFS. טוענים את הטבלה בקוד ומורידים את המסמכים ישירות לפי הנתיב המופיע בכל שורה.

איך טוענים

טוענים את הטבלה ישירות דרך ספריית datasets לקבלת פיצול המבחן, ומורידים את קובצי ה־PDF עצמם מתיקיית הייעודית בעזרת הפונקציה hf_hub_download. אין צורך באישור גישה מיוחד, המאגר פתוח לציבור. קובצי ה־PDF שמורים דרך Git LFS, כך שיש לקחת בחשבון הורדה נפרדת של קבצים בינאריים לצד טבלת ה־parquet. השדות המרכזיים לעבודה הם pdf_path, הטקסט של ה־prompt, ועמודות ה־rubric הרבות המשמשות לבדיקת הפלט של המודל.

from datasets import load_dataset

ds = load_dataset("surgeai/GDP.pdf")

הרישיון

הרישיון המדווח הוא MIT, שמתיר שימוש חופשי כולל שימוש מסחרי בכפוף למתן קרדיט. עם זאת, יוצרי הדאטהסט אוסרים מפורשות בכרטיס על שימוש בנתונים לצורך אימון מודלים מכל סוג ומייעדים אותו אך ורק להערכה ובחינה. מי שבונה מודל צריך להתייחס אליו ככלי מדידה בלבד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗