GPT
F

frames-benchmark

קוד פתוח

googleapache-2.02024-09-19

  • rag
  • long-context
  • llm-search
  • reasoning
  • factuality

גוגל שחררו בנצ'מרק שבוחן מערכות RAG בשאלות מורכבות שדורשות מידע מכמה מקורות במקביל. הוא נועד למדוד דיוק עובדתי, שליפה והסקה כשפרומפט פשוט כבר לא מספיק.

  • 12,744הורדות בחודש
  • 266לייקים

מה זה

המאגר כולל 824 שאלות מורכבות מסוג רב שלבי, שמחייבות איסוף וחיבור של נתונים מתוך שניים ועד 15 ערכי ויקיפדיה שונים כדי להגיע לתשובה. השאלות נוגעות במגוון נושאים רחב, החל מהיסטוריה ומדע, דרך ספורט ובעלי חיים, ועד בריאות.

כל שאלה בדאטהסט מתויגת לפי סוגי ההסקה הנדרשים כדי לפתור אותה. התיוגים כוללים חישובים מספריים, ניתוח טבלאות, התמודדות עם אילוצים מרובים, הבנה של ציר זמן ועיבוד נתונים לאחר השליפה. בנוסף לשאלות, המאגר מספק את תשובות הזהב ואת רשימת ערכי ויקיפדיה הרלוונטיים שנבחרו עבור כל שאלה.

הקובץ המרכזי שמופיע במאגר הוא קובץ מבחן בפורמט TSV, לצד תיעוד המאמר. לפי המפתחים, מודלים חזקים כמו ג'מיני פרו מתקשים כאן, עם דיוק של 40.8 אחוזים בפרומפט בסיסי וכ־73 אחוזים בלבד כשנותנים להם מראש את המסמכים הנכונים.

מתאים ל

  • הערכת צינורות RAG

    בדיקת היכולת של המערכת לשלוף מידע מכמה מסמכים שונים ולחבר ביניהם לתשובה נכונה.

  • מדידת הסקה מרובת שלבים

    בחינת מודלי שפה על שאלות שדורשות הצלבת תאריכים, אילוצים מרובים וחישובים מספריים.

  • בדיקת אסטרטגיות שליפה

    השוואה בין שליפה לקסיקלית כמו BM25 לבין שיטות שליפה סדרתיות מתקדמות.

איפה זה נופל

הבנצ'מרק כולו באנגלית ומבוסס בלעדית על ערכי ויקיפדיה, כך שהוא לא יעזור למי שבונה מערכת בעברית או מחפש ביצועים מול מסמכים ארגוניים מלוכלכים. בנוסף, יש בו רק 824 שאלות מבחן בלי סט אימון, וזה מתאים לבדיקת ביצועים בלבד ולא לכוונון מודלים. הנתונים תלויים במצב הערכים בוויקיפדיה נכון למועד איסופם, ולכן עובדות שהשתנו מאז עלולות לפגוע בדיוק הבדיקה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

כן, הרישיון הוא Apache 2.0 שמתיר שימוש מסחרי מלא. צריך רק לתת ייחוס לגוגל ולמחברי המאמר ולשמור על תנאי הרישיון המקוריים.

האם הדאטהסט כולל תמיכה בשפה העברית?

לא. כל 824 השאלות ומאמרי הוויקיפדיה המקושרים אליהן כתובים באנגלית בלבד. אם המוצר שלכם מיועד לעברית, תצטרכו לתרגם את השאלות ולמצוא מקבילות מתאימות בעצמכם.

האם יש במאגר דוגמאות לאימון מודלים?

לא, מדובר בבנצ'מרק להערכה בלבד שמכיל קובץ בדיקה עם 824 רשומות. הוא לא מיועד לאימון מודלים מאפס או ל־fine-tuning רחב אלא למדידת ביצועים של מערכות קיימות.

איך טוענים

הנתונים יושבים בקובץ test.tsv פשוט ונגיש ישירות דרך האתר בלי צורך בבקשת גישה מיוחדת. גודל הקובץ קטן מאוד ומכיל 824 דוגמאות מבחן, כך שאין כאן עומס זיכרון או צורך בחומרה ייעודית. השדות החשובים לטעינה ולעיבוד הם השאלות עצמן, תשובות הזהב, רשימת המאמרים הרלוונטיים מוויקיפדיה ותגיות ההסקה שמשמשות לחיתוך התוצאות.

from datasets import load_dataset

ds = load_dataset("google/frames-benchmark")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי ומחקר חופשי, ומאפשר להעריך מערכות פנימיות ומוצרים מסחריים בלי דרישה לפתוח את הקוד שלכם. התנאי המרכזי הוא מתן קרדיט וייחוס מתאים ליוצרים, יחד עם צירוף עותק של הרישיון המקורי בכל הפצה של הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗