GPT
R

rag_instruct_benchmark_tester

קוד פתוח

llmwareapache-2.02023-11-01

  • financial services
  • retrieval augmented generation
  • RAG
  • q&a instruct

מבחן ביצועים ממוקד לתרחישי שליפת מידע בארגונים, בעיקר בעולמות הפיננסים והמשפט. הוא כולל מאתיים שאלות עם קטעי הקשר שמדמים מצבי אמת כמו חוזים, חשבוניות ודוחות כספיים.

  • 189הורדות בחודש
  • 54לייקים

מה זה

המאגר מכיל 200 רשומות בפורמט שורות ג'ייסון, כשכל אחת כוללת שאלה, קטע מקור, תשובה נכונה, קטגוריה, מספר דגימה ומספר טוקנים. הטקסטים נלקחו ממקורות פומביים או נכתבו במיוחד עבור הבדיקה, והם מייצגים מסמכים ארגוניים כמו דוחות רווח, חדשות כלכליות, חוזים וטקסטים טכניים קצרים. הוא מחליף גרסאות בדיקה מוקדמות יותר של אותו צוות.

השאלות מחולקות לפי מטרות הערכה ברורות. מאה הדוגמאות הראשונות בודקות מענה ישיר מבוסס עובדות לקבלת ציון בסיסי. שאר מאה הדגימות מתחלקות שווה בשווה בין חמש קטגוריות של עשרים שאלות כל אחת: זיהוי מצבים שבהם המידע לא קיים בטקסט כדי למנוע הזיות, שאלות כן ולא, חישובים מתמטיים בסיסיים של אחוזים ושינויים, שאלות מורכבות שמצריכות קריאת טבלאות פיננסיות והסקה לוגית, ומשימות סיכום קצרות וארוכות.

מתאים ל

  • הערכת עמידות להזיות

    בדיקה אם המודל מזהה שמידע חסר בקטע במקום להמציא תשובה, בעזרת עשרים דוגמאות ייעודיות.

  • בדיקת שליפה בחוזים

    הרצת מבחני דיוק על שאלות משפטיות של תנאי ביטול ובעלות על קניין רוחני מתוך טקסט.

  • מדידת חישובים פיננסיים

    הערכת היכולת של המודל לחלץ נתונים מדוחות כספיים ולבצע פעולות חשבון ואחוזים בסיסיות.

איפה זה נופל

זה לא מאגר לאימון מודלים אלא סט בדיקה קטן מאוד של מאתיים דוגמאות בלבד. הוא מוגבל לשפה האנגלית, כך שאם המערכת שלכם צריכה להתמודד עם חוזים בעברית תצטרכו לתרגם או לבנות מבחן משלכם.

מעבר לכך, המפתחים מציינים שהנתונים נכתבו במיוחד או נגזרו ממקורות פומביים, אך אין פירוט מלא על אופן הסינון, מה שדורש בדיקה ידנית לפני שמסתמכים עליו כמדד יחיד להערכת מודל בארגון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון הוא אפאצ'י שתיים אפס ומתיר שימוש מסחרי חופשי. עליכם רק לתת קרדיט ליוצרים ולצרף עותק של הרישיון אם אתם מפיצים את הנתונים עצמם.

האם הדאטהסט כולל טקסטים בעברית?

לא. כל מאתיים הדוגמאות, השאלות וקטעי ההקשר מנוסחים באנגלית בלבד. אם המוצר שלכם מיועד לשוק המקומי, המאגר לא יבדוק ביצועים בעברית ללא תרגום והתאמה.

כמה המאגר גדול ואיך הוא מובנה?

מדובר במאגר זעיר של מאתיים שורות בקובץ ג'ייסון אחד. המבנה שלו פשוט מאוד וכולל טקסט מקור, שאלה, תשובה מוכנה וסיווג לקטגוריית הבדיקה.

האם המאגר מתאים לאימון של מודל שפה?

לא מומלץ. הוא קטן מדי ומיועד לשמש ככלי להערכת ביצועים של מערכות שליפת מידע, ולא כחומר ללימוד או לכוונון עדין.

איך טוענים

הקובץ המרכזי מגיע במבנה של שורות ג'ייסון, ללא צורך באישור גישה מיוחד, ומשקלו הכולל זעיר ביחס למאגרי אימון. פשוט מורידים את הקובץ וטוענים אותו ישירות בכל סביבת פיתוח.

הרשומות מכילות מפתחות אחידים של שאילתה, הקשר, תשובה וקטגוריה, מה שמאפשר להריץ מודל על פני קטעי ההקשר ולהשוות את התוצאה למפתח התשובה בלי עיבוד מקדים מורכב.

from datasets import load_dataset

ds = load_dataset("llmware/rag_instruct_benchmark_tester")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו בבדיקות של מוצרים פנימיים או מסחריים. הרישיון דורש מתן קרדיט ושמירה על תנאי הרישיון המקוריים, אך הוא אינו מחייב אתכם לחשוף קוד או מודלים שהערכתם בעזרתו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗