GPT
M

mt_bench_prompts

קוד פתוח

HuggingFaceH4apache-2.02023-07-03

  • evaluation

סט פרומפטים ממוקד שנועד להעריך מודלי שיחה במבחני המשך רב-שלביים. הוא מגיע ישירות מהעבודה של LMSYS ומספק בסיס קבוע לבדיקת איכות התשובות של צ'אטבוטים.

  • 18,137הורדות בחודש
  • 26לייקים

מה זה

המאגר מכיל פחות מאלף רשומות ומיועד למשימות שיחה ומענה על שאלות. במקור הפרומפטים נוצרו על ידי ארגון LMSYS לצורך בחינה והשוואה של ביצועי מודלי שפה, והחוקרים בצוות HuggingFaceH4 עיבדו אותם מחדש כדי שיתאימו לכלי העבודה הפנימיים שלהם.

המבנה הפנימי שנוצר בעקבות העיבוד כולל ארבעה שדות מרכזיים. שדה הטקסט של הפניות נקרא prompt, לצידו מופיע מזהה מספרי ייחודי בשם prompt_id שנגזר מחיתוך גיבוב של הטקסט, סיווג לפי נושא בשדה category, ושדה reference שמכיל תשובות ייחוס או נשאר ריק במקומות שבהם לא הוגדרה תשובה כזו.

הדאטה מבוסס על קובץ מקור בפורמט jsonl בשם raw/question.jsonl, שבו שדה הפניות המקורי נקרא turns לפני ששונה לצורתו הנוכחית. החלוקה במאגר כוללת פיצול יחיד של train, בלי סטים נפרדים לוולידציה או למבחן, מתוך מטרה לשמש כבנצ'מרק הרצה אחיד.

מתאים ל

  • הערכת מודלי שיחה

    הרצת פרומפטים מובנים לבדיקת איכות המענה של מודל שיחה באנגלית על פני קטגוריות שונות.

  • השוואת ביצועים

    בדיקת גרסאות שונות של אותו מודל מול סט שאלות קבוע כדי לזהות שיפורים או נסיגות.

  • בנצ'מרק פנימי לפיתוח

    בדיקה מהירה של מודל חדש לפני שחרור, באמצעות שאלות שיחה מוכנות ללא צורך בהגדרה מחדש.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שלמי שבונה או בוחן מודלים בעברית אין פה מענה ישיר. מעבר לזה, המאגר קטן מאוד ומכיל פחות מאלף דוגמאות, מה שאומר שהוא מתאים אך ורק להערכה ולא לאימון. הכרטיס לא מפרט אילו הטיות קיימות בטקסטים או איך בדיוק LMSYS סיננו את השאלות המקוריות, ופורסם באמצע 2023. לפני שמשלבים את המדד הזה בבדיקות של מוצר, חייבים לזכור שהוא בוחן יכולת שיחה כללית ולא התנהגות מול דרישות עסקיות ספציפיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון המדווח הוא apache-2.0 ומאפשר שימוש מסחרי מלא. אתם יכולים להעריך באמצעותו מערכות פנימיות ומוצרים שמיועדים ללקוחות משלמים. התנאי היחיד הוא שמירה על תנאי הרישיון ומתן ייחוס מתאים.

כמה המאגר שוקל וכמה זמן לוקח להוריד אותו?

המאגר כולל פחות מאלף רשומות ונשמר בקובץ Parquet בודד לצד קובץ טקסט גולמי. המשקל שלו זניח לחלוטין ונמדד במגה-בייטים בודדים. תהליך ההורדה והטעינה בסביבת הפיתוח מסתיים בתוך שניות ספורות.

האם יש במאגר שאלות בעברית?

לא, כל הנתונים מוגדרים תחת השפה האנגלית בלבד. אם המטרה שלכם היא לבחון יכולות שיחה בעברית, המאגר לא יספק את הסחורה. תצטרכו לתרגם את השאלות בעצמכם או לחפש סט ייעודי לשפה.

איך הנתונים האלה נוצרו ונאספו?

השאלות המקוריות נבנו על ידי ארגון LMSYS במסגרת המחקר שלהם על הערכת צ'אטבוטים. צוות HuggingFaceH4 לקח את קובץ השאלות המקורי, שינה את שמות השדות והוסיף מזהי גיבוב לצורך התאמה לכלי העבודה שלהם. התהליך המלא מתועד בקוד המצורף לעמוד הדאטהסט.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בפקודת load_dataset פשוטה, תוך ציון הנתיב ושם הפיצול train. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין לציבור וכולל קובץ Parquet בודד לצד קובץ ה־jsonl הגולמי. בגלל שמדובר בפחות מאלף שורות, ההורדה והטעינה לוקחות שניות בודדות ולא דורשות זיכרון מיוחד או משאבי מחשוב כבדים. השדות החשובים לריצה הם ה־prompt לצורך הפקת הפלט וה־category לניתוח התוצאות.

from datasets import load_dataset

ds = load_dataset("HuggingFaceH4/mt_bench_prompts")

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים. אתם יכולים להריץ את הבדיקות על מודלים מסחריים בלי לחשוף את הקוד שלכם, ואין חובת שיתוף באותו רישיון. החובה העיקרית היא מתן קרדיט ושמירה על הודעות הרישיון המקוריות של היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗