GPT
R

RAG-Evaluation-Dataset-KO

קוד פתוח

allganizemit2024-05-13

מבחן ביצועים ממוקד קוריאנית למערכות RAG שבודק שליפת מידע לא רק מפסקאות טקסט, אלא גם מתוך טבלאות ותמונות. אם אתם בונים פתרון שמטפל במסמכים עסקיים בקוריאנית, זה בנצ'מרק מעשי לבדיקת הצינור המלא.

  • 327הורדות בחודש
  • 113לייקים

מה זה

המאגר כולל 300 שאלות ותשובות מטרה שנבנו ידנית מתוך קובצי PDF בקוריאנית. המסמכים מחולקים לחמישה תחומים: פיננסים, מגזר ציבורי, רפואה, משפטים ומסחר. בכל תחום נאספו בין 9 ל־20 קבצים, בהיקף של 211 עד 301 עמודים לתחום, כאשר לכל קטגוריה הוצמדו 60 שאלות.

הייחוד במבנה הוא סיווג המקור לתשובה בשדה context_type. השאלות מחולקות לפי סוג העוגן הנדרש כדי לענות עליהן: פסקאות טקסט רגילות, טבלאות או תמונות, ביחס שתואם את שכיחות האלמנטים במסמכים המקוריים. קובץ documents.csv מרכז את שמות המסמכים, מספרי העמודים וקישורים למקורות, וקובץ rag_evaluation_result.csv מציג את תוצאות ההרצה של פתרונות RAG ומודלים שונים שנבחנו על המאגר.

מתאים ל

  • בדיקת RAG בקוריאנית

    הערכת צינור שלם שכולל פענוח מסמכים, שליפה ומענה בקוריאנית מול שאלות מוגדרות.

  • בחינת שליפה מטבלאות

    בדיקה נקודתית של יכולת המערכת לחלץ מידע מובנה ומספרי מתוך טבלאות מורכבות.

  • השוואת מנועי החלפה

    השוואה בין ביצועי מודלים סגורים כמו קלוד ו־GPT לבין מודלי קוד פתוח מקומיים.

איפה זה נופל

הנתונים כולם בקוריאנית, ללא מילה אחת בעברית או באנגלית, כך שהם חסרי תועלת לחלוטין לבדיקת מודלים בשפות שאינן קוריאנית. 300 שאלות זה מדגם קטן מאוד שמספיק לאינדיקציה ראשונית אך לא להערכה סטטיסטית יציבה של מודל לייצור. בנוסף, שיטת הבדיקה האוטומטית המוצגת מבוססת על מודלי שפה אחרים וסובלת מסטייה של כ־8 אחוזים מול תיוג אנושי, לפי בדיקת היוצרים בתחום הפיננסי.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מערכת בעברית?

לא. כל המסמכים, השאלות והתשובות מנוסחים בקוריאנית בלבד. אין כאן נתונים בעברית ולא ניתן להשליך מהביצועים עליו על טיפול בטקסט עברי.

מותר להשתמש בדאטהסט לפרויקט מסחרי של חברה?

כן, רישיון MIT מאפשר שימוש מסחרי חופשי לחלוטין. צריך רק לוודא שמצרפים את עותק הרישיון המקורי בקוד או בהפצה.

איך נאספו התשובות והאם הן אמינות?

צוות המפרסמים ייצר את השאלות ותשובות המטרה מתוך קובצי ה־PDF שנאספו. ההערכה של התוצאות התבססה על הצבעה בין ארבעה מדרגי מודלי שפה שונים, עם שגיאה מוערכת של כשמונה אחוזים בהשוואה להערכת אדם.

כמה שאלות יש בדאטהסט והאם הוא שוקל הרבה?

המאגר קל מאוד ומכיל בסך הכל ארבעה קבצים, ביניהם קובצי CSV בנפח של פחות מכמה מגה-בייטים בודדים. יש בו 300 שאלות בסך הכל, 60 לכל אחד מחמשת התחומים.

איך טוענים

אין צורך בהרשאה מיוחדת כדי לגשת לנתונים. מורידים את קובצי ה־CSV ישירות מהמאגר או טוענים אותם באמצעות ספריית datasets. הנתונים מאורגנים בטבלאות פשוטות, כאשר עמודת המפתח היא סוג ההקשר והשיוך לתחום. כדאי לשים לב שתוכן ה־PDF עצמו מקושר דרך קובץ ה־CSV ולא תמיד יושב ישירות כטקסט חתוך בתוך הדאטהסט, כך שתצטרכו להוריד ולפרסר את המסמכים כדי לבחון את שלב השליפה מאפס.

from datasets import load_dataset

ds = load_dataset("allganize/RAG-Evaluation-Dataset-KO")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו בפרויקטים סגורים. הדרישה היחידה היא שמירת הודעת זכויות היוצרים והרישיון המקורי. אימון מודל או הערכה על בסיס הנתונים לא כובלים אתכם בפתיחת הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗