GPT
O

open_ragbench

קוד פתוח

vectaracc-by-nc-4.02025-04-26

יש כאן גם סקירה על Vectara עצמו.

אלף מאמרי מחקר מפורקים עם תמונות וטבלאות, יחד עם שאלות שנבנו עליהם. המאגר בודק כמה טוב מנוע חיפוש מוצא מידע משולב בתוך מסמכים מורכבים ולא רק טקסט נקי.

  • 2,312הורדות בחודש
  • 34לייקים

מה זה

המאגר כולל אלף מאמרי מחקר מאתר arXiv ומחולק בצורה שמזכירה את פורמט BEIR. מתוך אלף המסמכים, 400 מוגדרים כמסמכי מקור חיוביים שמכילים את המידע הדרוש למענה, ועוד 600 הם מסמכים לא רלוונטיים שמאתגרים את מנוע החיפוש.

בפנים תמצאו 3,045 זוגות של שאלות ותשובות. החלוקה היא 1,793 שאלות סיכומיות שמחייבות הבנה רחבה, ו־1,252 שאלות חילוץ עובדתיות. ברמת המדיה, 1,914 שאלות מתבססות על טקסט בלבד, 763 דורשות שילוב של טקסט ותמונה, 148 משלבות טקסט וטבלה, ועוד 220 שאלות דורשות הצלבה של טקסט, טבלה ותמונה יחד.

המסמכים עברו פירוק בעזרת זיהוי תווים אופטי, וכל מאמר נשמר בקובץ משלו. הטבלאות שמורות בפורמט Markdown והתמונות מקודדות במחרוזות Base64 ישירות בתוך החלקים של המסמך, לצד קישורים למסמכי המקור ברשת.

מתאים ל

  • בדיקת שליפת תמונות וטבלאות

    מדידת הדיוק של מנוע חיפוש בהחזרת מקטעים שמכילים מידע ויזואלי ומורכב.

  • אימון מודלים להבנת מסמכים

    פיתוח מודלי מחקר שיודעים לענות על שאלות הדורשות הצלבת נתונים מכמה מקורות במאמר.

  • הערכת עמידות לרעש

    בדיקת יכולת המערכת לסנן 600 מסמכים לא רלוונטיים ולא לשלוף תשובות שגויות.

איפה זה נופל

כל החומר נשען אך ורק על מאמרים אקדמיים בשפה האנגלית, ולכן הוא לא מייצג מסמכים עסקיים, חוזים או תוכן בעברית. יוצרי המאגר מציינים שחילוץ הנתונים מתקשה במסמכים לא מובנים ושיש קושי אמיתי בחיבור הנכון בין תמונות וטבלאות לטקסט שסביבן. בנוסף, כל השאלות והתשובות נוצרו וסוננו בעזרת gpt-4o-mini ומודלי הטמעה, כך שהמאגר מכיל הטיות מובנות של בינה מלאכותית ולא נבדק ידנית על ידי מומחים אנושיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0 ומגביל את השימוש למטרות שאינן מסחריות בלבד. אם המטרה היא להטמיע את המידע באפליקציה עסקית או לאמן מודל מסחרי, המאגר הזה לא מתאים.

האם יש במאגר תוכן בעברית?

לא, כל החומר מבוסס על מאמרים מדעיים מאתר arXiv באנגלית בלבד. מי שמחפש לבדוק ביצועים של מערכות חיפוש בעברית יצטרך לפנות למקורות אחרים.

איך נוצרו השאלות והתשובות?

השאלות והתשובות הופקו בצורה אוטומטית באמצעות המודל gpt-4o-mini מתוך מקטעי המאמרים. לאחר מכן בוצע סינון של איכות השאלות והתאמתן בעזרת המודל הזה ומספר מודלי הטמעה מובילים.

במה הוא שונה ממאגרי RAG רגילים?

רוב המאגרים בודקים חיפוש של פסקאות טקסט בלבד. כאן כל מסמך עבר חילוץ של טבלאות ותמונות, והשאלות נבנו במיוחד כדי לבחון שליפה של מידע גרפי שמשולב בטקסט.

איך טוענים

אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. המבנה מורכב מיותר מאלף קבצי JSON נפרדים, כשהמאמרים יושבים תחת תיקיית corpus ולצידם קבצים מרכזיים לשאלות, תשובות, קישורים ומיפוי הרלוונטיות בין שאלה לחלק המדויק במאמר. התמונות שמורות כטקסט Base64 בתוך הנתונים, אז כדאי לקחת בחשבון שקריאת הקבצים דורשת זיכרון ופענוח מתאים לפני שמתחילים לעבוד.

from datasets import load_dataset

ds = load_dataset("vectara/open_ragbench")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0. המשמעות ברורה וחד משמעית: השימוש מותר רק לצורכי מחקר, לימוד ובדיקות פנימיות. אסור להשתמש בנתונים האלה כדי לבנות שירות בתשלום, להטמיע אותם במוצר מסחרי או לאמן עליהם מודל שמיועד להפצה מסחרית, ותמיד חובה לתת קרדיט ליוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗