GPT
R

role-play-bench

קוד פתוח

MiniMaxAIapache-2.02026-01-27

המאגר מרכז תרחישי משחק תפקידים בסינית ובאנגלית עם ציוני הערכה רב ממדיים. הוא מיועד לבדיקת יציבות, עקביות עלילתית ומניעת שבירת דמות בשיחות ארוכות של מודלים.

  • 398הורדות בחודש
  • 149לייקים

מה זה

הנתונים כוללים תרחישים סינתטיים שנבנו עבור הערכת סוכני שיחה, ומחולקים לשתי תצורות שפה: סינית עם 50 תרחישי בסיס ו־1,650 דיאלוגים, ואנגלית עם 45 תרחישי בסיס ו־1,485 דיאלוגים. כל מפגש כולל מהלכי שיחה באורך של 100 תורות שנאספו באמצעות משחק עצמי בין מודלים, כשהסוכן עומד מול סימולטור משתמש.

המבנה מאורגן בשלוש טבלאות נפרדות לכל שפה: הגדרות הבסיס עם תיאורי הדמויות והפתיחה, הדיאלוגים המלאים שנשמרים עם מזהה הרצה ומספר התורות, וטבלת הערכות שמכילה ששה ציונים מספריים מ־0 עד 100. הציונים מודדים איכות טקסט, עקביות לוגית, אמינות עובדתית, גיוון ביטוי, קוהרנטיות עלילתית ואיכות אינטראקציה, כולל ענישה על דיבור במקום המשתמש.

מתאים ל

  • בנצ'מרק למודלי שיחה

    מדידת יכולת שמירה על דמות ומניעת חזרתיות בשיחות ארוכות של עד 100 תורות.

  • אימון שופט אוטומטי

    שימוש בציוני ההערכה המצורפים לאימון מודלי LLM-as-a-Judge שמזהים שבירת דמות.

  • בדיקת עמידות לקלט רועש

    בחינת תגובות הסוכן תחת פניות משתמש מקוטעות או שינויי סגנון יזומים.

איפה זה נופל

כל הדיאלוגים הם טקסט סינתטי שנוצר על ידי מודלים ולא שיחות אנושיות אמיתיות, עם הטיה מובהקת לסגנון צ'אט מקוון. אין כאן מילה אחת בעברית, אלא רק אנגלית וסינית. בנוסף מדובר בתת-קבוצה חלקית בלבד מתוך הבנצ'מרק המלא של החברה, והחומרים כוללים שיבושים יזומים בקלטים ובמבנה ההנחיות כדי לבחון עמידות, כך שהטקסט אינו נקי מרעשים.

שאלות
נפוצות

האם המאגר כולל שיחות בעברית?

לא. המאגר כולל אך ורק נתונים בשפות אנגלית וסינית, ואין בו תמיכה או ייצוג לשפה העברית.

האם מותר להשתמש בנתונים לפיתוח מוצר מסחרי?

יש להיזהר. קיים פער בין הרישיון המוצהר Apache 2.0 לבין ציון הרישיונות CC BY 4.0 או CC BY-SA 4.0 בגוף התיעוד. תנאי רישיון שיתוף זהה עלולים להגביל הפצה של תוצרים נגזרים.

מאיפה הגיעו הדיאלוגים במאגר?

הנתונים נוצרו בצורה סינתטית לחלוטין על ידי צוות המידע באמצעות סימולטור משתמש ומודלים ששיחקו זה מול זה. לא מדובר בשיחות שנאספו ממשתמשי קצה אנושיים.

באיזה פורמט שמורים הנתונים?

הקבצים זמינים בפורמטים Parquet ו־JSONL בתוך 14 קבצים במאגר. הם מחולקים לתיקיות נפרדות עבור אנגלית וסינית לפי טבלאות בסיס, שיחות וציונים.

איך טוענים

טעינת המאגר מתבצעת ישירות דרך ספריית datasets באמצעות ציון התצורה הרצויה, zh או en. המאגר פתוח לחלוטין להורדה ללא צורך באישור גישה מראש. הקבצים שמורים בפורמט Parquet לצד עותקי JSONL, ומכילים בין 1,000 ל־10,000 רשומות בסך הכל. לצורך ניתוח תוצאות, השדות המרכזיים הם dialogue המכיל את רשימת התורות, וטבלאות ה־evaluations המקושרות לפי מזהה התרחיש ומזהה הריצה.

from datasets import load_dataset

ds = load_dataset("MiniMaxAI/role-play-bench")

הרישיון

קיים חוסר התאמה ברור במאגר. המטא-דאטה מדווח על רישיון Apache 2.0 המתיר שימוש מסחרי חופשי, אך בגוף הכרטיס מצוין רישיון CC BY 4.0 או CC BY-SA 4.0. אם חל רישיון ShareAlike, כל יצירה נגזרת עשויה לחייב שיתוף באותם תנאים, מה שיוצר סיכון משפטי באימון מודלים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗