GPT
W

WildBench

קוד פתוח

allenaiרישיון לא דווח2024-02-23

אפשר גם להריץ אותו בדפדפן בלי להתקין דבר.

המאגר מרכז אינטראקציות מורכבות של משתמשים אמיתיים מול מודלי שפה, עם תיוגים מפורטים ותשובות ייחוס. הוא מתאים למי שמחפש להעריך מודל על אתגרים מציאותיים ולא על מבחנים סינתטיים מנותקים.

  • 1,752הורדות בחודש
  • 40לייקים

מה זה

הרשומות כאן מייצגות שיחות שלמות של משתמשי קצה, שנלקחו מתוך פרויקט WildChat. כל דוגמה כוללת את קלט השיחה המלא, שפת הקלט, חיווי על צנזור פרטים או רעילות, ותפקיד הדובר. בנוסף תמצאו תיוגי כוונות, תגיות סיווג ראשיות ומשניות, הערכת התאמה, רשימת שאלות להערכת הפלט ותשובת ייחוס שנוצרה על ידי מודל GPT-4 לצורך השוואה.

במקור פורסמו בגרסה הראשונה 1,024 דוגמאות שנבחרו בשל רמת הקושי והגיוון שלהן. המאגר עצמו מחולק לפי גרסאות שונות בקובצי פרקט, כולל גרסה ראשונה, גרסה שנייה וגרסה ממוקדת משימות קשות, המכילות חלוקות למבחן ולאימון.

מתאים ל

  • בנצ'מרק למודלי שפה

    הרצת מודלים על שאלות משתמשים אמיתיות ובדיקת התוצאות מול רשימות השאלות ותשובות הייחוס.

  • אימון על משימות מורכבות

    שימוש בפיצול האימון של גרסת v2-hard כדי לשפר יכולות פתרון בעיות קשות במודלים.

  • מחקר על כוונות משתמש

    ניתוח התפלגות התוכן והאינטראקציה האנושית בעזרת התגיות וסיווגי הכוונות שמצורפים לכל שיחה.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, כך שהוא לא יעזור לכם לבחון התנהגות בעברית או במשימות מקומיות. ההערכות האוטומטיות נשענות על תשובות ייחוס של GPT-4, מה שמכניס הטיה מובנית לכיוון הסגנון והטעויות של המודל המסוים הזה. בנוסף, מדובר בשיחות שנאספו ממשתמשים אקראיים, ולמרות סינוני רעילות וצנזור שמופיעים בשדות המידע, יש לבדוק ידנית מדגם לפני שמשלבים את המידע באימון ישיר של מוצר כדי למנוע דליפת מידע פרטי או תוכן בעייתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לצרכים מסחריים?

הכרטיס מציין רישיון CC BY המאפשר שימוש מסחרי בכפוף למתן ייחוס. לצד זה, היוצרים דורשים לעמוד בהנחיות השימוש האחראי של מכון אלן, שאוסרות פגיעה או גרימת נזק. אם אתם בונים מוצר, מומלץ לוודא שהשימוש שלכם מתיישר עם מגבלות אלו.

האם הדאטהסט כולל תמיכה בעברית?

הנתונים במאגר מתויגים ומוגדרים רשמית באנגלית בלבד. לא תמצאו כאן שיחות או בדיקות המיועדות לשפה העברית. אם המטרה היא הערכת ביצועים לשוק הישראלי, תצטרכו לחפש מאגרים מקומיים או לתרגם את המשימות.

איך המאגר הזה שונה ממבחני ביצועים רגילים?

בניגוד למבחנים מלאכותיים עם שאלות אמריקאיות, כאן המשימות נולדו מפניות אמיתיות של אנשים לפרויקט WildChat. הוא כולל תיוגים עמוקים של כוונות ורשימות שאלות ספציפיות להערכת איכות הפלט, במקום להסתמך רק על התאמת טקסט יבשה.

כמה מקום המאגר תופס בדיסק?

מדובר במאגר קטן יחסית שנמצא בטווח של אלף עד עשרת אלפים רשומות ומחולק לשישה קבצים בלבד. כל הנתונים שמורים בפורמט פרקט מכווץ, כך שההורדה מהירה מאוד ותופסת נפח אחסון מינימלי על המחשב.

איך טוענים

אתם טוענים את הדאטה ישירות דרך ספריית datasets באמצעות ציון המזהה, הגרסה המבוקשת והחלק הרצוי, למשל גרסת v2 עם פיצול test. אין צורך באישור גישה מיוחד, והקבצים יורדים בפורמט פרקט קומפקטי ומהיר לקריאה. השדות המרכזיים לעבודה הם conversation_input שמחזיק את תוכן ההודעות, checklist שמשמש כלי עזר לבחינת התוצאה, ו־references שמספק את תשובת GPT-4 לצורך כיול והשוואת הביצועים.

from datasets import load_dataset

ds = load_dataset("allenai/WildBench")

הרישיון

בכרטיס התיעוד מופיע רישיון CC BY 4.0 שמתיר שימוש, הפצה ושינוי, כולל לצרכים מסחריים, תחת מתן קרדיט ליוצרים. עם זאת, היוצרים מציינים שהשימוש כפוף להנחיות השימוש האחראי של מכון אלן, האוסרות גרימת נזק. אם אתם מאמנים מודל על הנתונים, הרישיון דורש ייחוס מתאים, אך אינו מחייב אתכם לשחרר את המודל עצמו תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗