GPT
R

repliqa

קוד פתוח

ServiceNowcc-by-4.02024-06-11

  • croissant

מאגר שאלות ותשובות שמבוסס על מסמכים מומצאים לחלוטין. הוא בודק אם מודל שפה באמת מחלץ מידע מהקונטקסט שנתתם לו, או שהוא סתם זוכר עובדות מאימוני עבר.

  • 5,820הורדות בחודש
  • 24לייקים

מה זה

המאגר כולל שלשות של קונטקסט, שאלה ותשובה. הטקסטים נכתבו על ידי בני אדם ועוסקים בישויות פיקטיביות שלא קיימות במציאות, כמו אנשים, חברות או מקומות. הכותבים השתמשו במחוללי שמות רנדומליים ובכלי אנונימיזציה כדי לוודא שאין הצלבה עם ישויות אמיתיות. המסמכים מכסים שבעה עשר נושאים שונים, ובהם מדיניות חברות, דיווחי תקריות, חדשות אבטחת מידע, כלכלה מקומית ופולקלור.

כל מסמך מכיל כאלף מילים, וממנו הופק סיכום אוטומטי ששימש מדרגים לכתיבת חמש שאלות ישירות. לאחר מכן נענו השאלות על בסיס המסמך המלא. כעשרים אחוז מהשאלות בכוונה אינן ניתנות למענה מתוך הטקסט, ומודל נדרש לסמן זאת במפורש. בבקרת האיכות הראשונית נפסלו בין חמישה לעשרה אחוזים מהדגימות לפני הניקוי הסופי.

המאגר תוכנן לחלוקה לחמישה חלקים שמשתחררים בהדרגה בין יוני 2024 ליוני 2025 כדי למנוע זליגת נתונים לאימונים חדשים. במאגר קיימים קובצי Parquet של הנתונים עצמם לצד עשרות אלפי קובצי PDF מקוריים של המסמכים.

מתאים ל

  • הערכת מערכות RAG

    בדיקה מבודדת של יכולת המודל לשלוף תשובות רק מתוך מסמכי מקור שהוזרקו לו, בלי להסתמך על ידע קודם.

  • מדידת סירובים והזיות

    בחינה אם המערכת יודעת לעצור ולהחזיר חוסר מידע על שאלות שאין להן מענה במסמך, בלי להמציא עובדות.

  • סיווג נושאי מסמכים

    אימון ובדיקה של מנועי שליפה וסיווג לפי שבעה עשר הנושאים השונים שמוגדרים במסמכים.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שלמי שמחפש בדיקה בעברית אין מה לעשות כאן ישירות. יש בדאטה גם רעשים טכניים שהמפתחים מודים בהם, כמו קטעים שנראים כמו קוד וסוגריים מרובעים או משולשים. בדיקות של המסמכים בכלי Fast-DetectGPT הראו ציונים חריגים ושונים מדאטהסטים רגילים כמו FineWeb. מעבר לכך, שדה long_answer סופק כפי שהוא ללא בדיקה אם הפסקה אכן מופיעה במסמך המקורי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקטים מסחריים?

כן, הרישיון הוא CC BY 4.0 שמתיר שימוש מסחרי חופשי. התנאי המרכזי הוא מתן קרדיט ברור ליוצרים ב־ServiceNow וציון שינויים אם ביצעתם כאלה בנתונים.

האם יש במאגר תמיכה בעברית?

לא. כל המסמכים, השאלות והתשובות נכתבו באנגלית בלבד. אם המטרה היא להעריך מערכות בעברית, תצטרכו לתרגם את החומר או לייצר מקבילה מקומית.

איך בנו את המסמכים כדי שלא יתנגשו עם מידע אמיתי?

כותבים אנושיים יצרו ישויות בדויות של אנשים ומקומות בעזרת מחוללי שמות רנדומליים וכלי אנונימיזציה. המטרה הייתה לוודא שהפרטים לא מתועדים בשום מקום אחר ברשת, כדי שמודלים לא יוכלו לשלוף תשובות מהזיכרון שלהם.

במה הוא שונה מדאטהסטים רגילים של שאלות ותשובות?

ברוב המאגרים מודלים גדולים עונים נכון פשוט כי המידע הופיע באינטרנט בזמן האימון שלהם. כאן המידע מומצא ולכן תשובה נכונה מעידה בוודאות על הבנה וקריאה של הקונטקסט שהוגש למודל, ולא על שליפה מוקדמת מהזיכרון.

איך טוענים

טוענים את הנתונים ישירות דרך קובצי Parquet שמחולקים לפי גרסאות השחרור, לצד תיקיית מסמכי מקור בפורמט PDF. אין צורך באישור גישה מקדים, המאגר ציבורי לחלוטין. השדות החשובים לניתוח הם document_extracted שמכיל את הטקסט המלא, question, ו־answer. במקרים שבהם אין תשובה בטקסט, שדה התשובה יכיל במדויק את הערך UNANSWERABLE. בנוסף קיים שדה long_answer שמכיל את הפסקה שהמעריך העתיק, אך הכרטיס מציין שהפסקה הזו לא אומתה מול הטקסט ולכן כדאי להתייחס אליה בזהירות.

from datasets import load_dataset

ds = load_dataset("ServiceNow/repliqa")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0. מותר להשתמש בו לצרכים פנימיים, מחקריים ומסחריים, כולל שינוי ושיתוף, כל עוד נותנים קרדיט מתאים ל־ServiceNow ומציינים אם נעשו שינויים. אין דרישה לשתף תוצרים באותו הרישיון. הקוד הנלווה בגיטהאב מופץ ברישיון MIT.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗