GPT
C

ChatRAG-Bench

קוד פתוח

nvidiaother2024-04-29

  • RAG
  • ChatRAG
  • conversational QA
  • multi-turn QA
  • QA with context

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

עשרה מאגרי שיחה קיימים מאוחדים לבנצ'מרק אחד שבודק שליפת מידע מורכבת. הוא מיועד למי שרוצה למדוד מודלי שיחה על מסמכים, טבלאות, חישובים ומצבים שבהם אין תשובה בטקסט.

  • 2,317הורדות בחודש
  • 118לייקים

מה זה

המאגר מרכז דוגמאות שיחתיות מתוך עשרה מקורות שונים: Doc2Dial, QuAC, QReCC, CoQA, DoQA, ConvFinQA, SQA, TopioCQA, HybriDialogue ו־INSCIT. הרשומות מציגות דיאלוג רב שלבי מול מסמך או טקסט שנשלף, ודורשות מהמודל להבין הקשר ארוך, לחלץ מידע מטבלאות ולבצע חישובים אריתמטיים.

המבנה הפנימי מחולק לתיקיות לפי מאגרי המקור עם קובצי json של סטים לפיתוח ולבדיקה. חלק מהקבצים מחולקים לנושאים ספציפיים, כמו בישול, סרטים ונסיעות בתוך DoQA, לצד קובצי מסמכים נפרדים כמו ב־Doc2Dial. בנוסף למענה רגיל, המאגר כולל תרחישים ייעודיים לבדיקת שאלות שאין להן תשובה בהקשר הנתון על בסיס QuAC ו־DoQA.

מתאים ל

  • מדידת ביצועי RAG בשיחה

    בדיקת יכולת המודל לענות על שאלות המשך מתוך מסמכים ארוכים וטקסט שנשלף.

  • זיהוי היעדר תשובה בהקשר

    בחינת יכולת המודל לסרב לענות כשאין מידע מתאים, כדי למנוע הזיות במוצר.

  • מענה מבוסס טבלאות וחישוב

    הערכת היכולת להבין מבנה נתונים טבלאי ולבצע עליו פעולות חשבון לפי נתוני ConvFinQA.

איפה זה נופל

הנתונים כולם באנגלית בלבד. אם המוצר שלכם פונה לקהל ישראלי או דורש עבודה בעברית, הבנצ'מרק הזה לא ייתן לכם שום אינדיקציה לביצועים. מעבר לכך, המאגר מבוסס כולו על חומרי עבר שפורסמו בין השנים 2017 ל־2023, כך שהמידע אינו עדכני. מודלים מודרניים רבים כבר ראו חלק ממאגרי המקור במהלך האימון הראשוני שלהם, מה שעלול לייצר תוצאות מוטות במבחני דיוק.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר מוגדר תחת רישיון other ואין לו רישיון שימוש אחיד. אנבידיה מציינת שהחומרים נלקחו מעשרה מאגרים שונים ומפנה לרישיונות המקוריים שלהם. לפני שמאמנים או מפיצים מודל, חובה לבדוק בנפרד את תנאי השימוש של כל אחד מעשרת המקורות.

האם הדאטהסט כולל שאלות או מסמכים בעברית?

לא, כל הנתונים במאגר הם באנגלית בלבד. המקורות כולם מבוססים על מחקרים קודמים שפורסמו בשפה האנגלית. למערכות שפועלות בעברית הוא לא רלוונטי לצורכי בדיקה ישירה.

איך המאגר הזה נאסף והורכב בפועל?

הוא נבנה מאיחוד של עשרה מאגרי שיחה קיימים שנאספו בין השנים 2017 ל־2023. אנבידיה ריכזה מתוכם משימות שונות של שיחה מול מסמכים, שאלות פיננסיות וטבלאות. החלק של שאלות ללא מענה נשען על חלוקה מתוך המאגרים QuAC ו־DoQA.

במה הוא שונה מסתם עוד מבחן RAG רגיל?

במקום לבדוק שליפה של עובדה בודדת, הוא מתמקד בדיאלוג מתמשך שדורש מעקב אחרי שיחה שלמה. בנוסף יש בו בדיקה מוגדרת למצבים שבהם המידע לא קיים בטקסט, לצד דרישה לחישובים והבנת טבלאות.

איך טוענים

טוענים את הנתונים ישירות מקובצי ה־json שבמאגר או דרך סקריפטי ההערכה הפתוחים שפרסמה אנבידיה בתיקיית evaluation. אין צורך בבקשת גישה מיוחדת או באישור ידני כדי להוריד את הקבצים. גודל המאגר נע בין אלף לעשרת אלפים רשומות שמפוזרות על פני עשרים וארבעה קבצים. בעבודה שוטפת צריך לשים לב למבנה השדות שמשתנה בין מקורות המידע, לקובצי ה־documents הנפרדים ולשאלות ללא מענה שמחייבות לוגיקת בדיקה שונה.

from datasets import load_dataset

ds = load_dataset("nvidia/ChatRAG-Bench")

הרישיון

הרישיון מוגדר בתור other ואינו מעניק היתר אחיד. אנבידיה מבהירה שהנתונים נגזרו ממאגרים קיימים ומפנה לרישיון המקורי של כל אחד מעשרת המקורות. המשמעות היא שאי אפשר להסתמך עליו כמאגר חופשי, ובמידה ותרצו להשתמש בו לאימון מודל מסחרי תצטרכו לבדוק בעצמכם את תנאי השימוש של כל דאטהסט בנפרד.

הרישיון המלא ב־Hugging Face ↗