GPT
D

document-haystack

קוד פתוח

AmazonScienceרישיון לא דווח2025-04-28

  • long-context
  • multimodal
  • llm
  • vlm
  • benchmark

מבחן ביצועים ייעודי לשליפת מידע ממסמכים ארוכים בני 5 עד 200 עמודים. הוא בודק מודלי ראייה ושפה מול מחטים סינתטיות של טקסט או תמונה שהושתלו בעומקים שונים.

  • 45,353הורדות בחודש
  • 20לייקים

מה זה

המאגר כולל 400 גרסאות של מסמכים וסך הכל 8,250 שאלות שליפה ייחודיות. הוא בנוי על גבי 25 מסמכי מקור אמיתיים מעולמות כמו דוחות של חברות, ביניהן AIG, אמריקן איירליינס ובנק מונטריאול, באורכים של 5, 10, 25, 50, 75, 100, 150 ועד 200 עמודים.

בתוך המסמכים האלה החוקרים הטמיעו מחטים במבנה קבוע של מפתח וערך, למשל הספורט הסודי הוא כדורסל. בחצי מהמקרים הערך מופיע כטקסט פשוט, ובחצי השני הערך עצמו מוטמע כתמונה זעירה בתוך העמוד. עבור כל גרסה תקבלו קובץ PDF מלא, תמונות JPG מרונדרות של כל עמוד בנפרד ברזולוציה של 200 DPI, וקבצי טקסט מחולצים לגרסאות הטקסטואליות בלבד, יחד עם קובצי מטא דאטה מדויקים של מיקום המחט לפי קואורדינטות, פונט וצבע.

מתאים ל

  • מדידת דעיכת קשב במסמך ארוך

    בדיקת יכולת המודל לשלוף פרטים מתוך 200 עמודים כתלות במיקום המחט לאורך הדוח.

  • השוואת שליפת תמונה מול טקסט

    מדידה אם המודל מזהה טוב יותר ערך שמופיע כטקסט רגיל לעומת ערך שמופיע כתמונה בתוך העמוד.

  • בחינת עיבוד PDF מול תמונות

    השוואת ביצועי הראייה של מודל המקבל דפים כ־JPG מול מודל שמקבל את קובץ ה־PDF המקורי.

איפה זה נופל

זהו מבחן ביצועים סינתטי ולא מאגר שמלמד הבנת שפה טבעית או ניתוח דוחות. המחטים הושתלו באופן שרירותי, כך שאין שום קשר הגיוני בין תוכן המסמך לבין השאלה על הפריט הסודי. המאגר קיים באנגלית בלבד וכולל מסמכים מערביים, בלי שום ייצוג לעברית או לטקסט מימין לשמאל. בנוסף, הוא בודק שליפה פשוטה של ערך בודד לפי מפתח קשיח, מה שלא בודק יכולות הסקה מורכבות, השוואה בין סעיפים שונים או סיכום תוכן אמיתי מתוך מסמך עסקי.

שאלות
נפוצות

האם מותר להשתמש במאגר הזה לפרויקט מסחרי?

לא. המאגר מוגן תחת רישיון CC-BY-NC-4.0, שמתיר שימוש מחקרי בלבד. כל שימוש מסחרי או שילוב שלו במוצר שמייצר הכנסות אסור בהחלט.

האם יש במאגר תמיכה בעברית?

אין שום תמיכה בעברית. כל 25 המסמכים והשאלות כתובים באנגלית בלבד. אם אתם בונים מערכת למסמכים בעברית, תצטרכו לייצר סט בדיקה עצמאי באותו היגיון.

איך המאגר בנוי ומאורגן בפועל?

הוא מחולק ל־25 תיקיות ראשיות לפי מסמכי המקור, ובתוכן תתי תיקיות לפי אורכי עמודים מ־5 ועד 200. בכל תיקייה תמצאו את ה־PDF המקורי, תמונות JPG של כל עמוד בנפרד, קבצי טקסט וטבלאות CSV שמפרטות את מיקום המחטים.

במה הוא שונה ממבחן Needle in a Haystack רגיל?

מבחן רגיל בודק לרוב טקסט רציף בלבד בתוך חלון הקשר. כאן המחטים מושתלות בתוך פריסה גרפית של מסמכים מורכבים, כשטקסט או תמונות ממוקמים בקואורדינטות אמיתיות על גבי עמודים מעוצבים.

איך טוענים

המאגר לא דורש אישור גישה מיוחד, אבל הוא שוקל המון ומורכב מ־47,177 קבצים. אם תנסו למשוך אותו ישירות דרך הספרייה בלי לחשוב, אתם תורידו עשרות אלפי תמונות עמודים וקבצי PDF כבדים. למי שרק רוצה לבחון מודל טקסטואלי רגיל, עדיף לסנן מראש רק את תיקיות הטקסט ולוותר על ה־JPG. הקבצים החשובים לניהול הבדיקה הם needles.csv שמחזיק את צמדי המפתח והערך, prompt_questions.txt שמכיל את שאלות השליפה, ו־needles_info.csv שמאפשר לאמת איפה בדיוק המחט ישבה בעמוד כדי לנתח כשלי שליפה לעומק.

from datasets import load_dataset

ds = load_dataset("AmazonScience/document-haystack")

הרישיון

למרות שבמטא דאטה הראשי לא צוין רישיון, בתוך הטקסט של התיעוד מוגדר רישיון CC-BY-NC-4.0. המשמעות ברורה: שימוש מחקרי ולא מסחרי בלבד, עם חובת מתן קרדיט ליוצרים. אסור להשתמש במאגר לפיתוח מוצרים מסחריים, לאימון מודלים שמיועדים למכירה או לכל פעילות שמפיקה רווח.

הרישיון המלא ב־Hugging Face ↗