GPT
W

WildChat-1M

קוד פתוח

allenaiodc-by2024-05-03

  • instruction-finetuning

מיליון שיחות אמיתיות של משתמשים עם ChatGPT כולל מטא-דאטה עשיר. המאגר נותן הצצה נדירה לאיך אנשים באמת מתקשרים עם מודלים בעולם האמיתי.

  • 20,432הורדות בחודש
  • 459לייקים

מה זה

הנתונים מציגים מיליון שיחות מלאות שנאספו ממשתמשים אנונימיים שקיבלו גישה חופשית למודלים של OpenAI. רוב מוחלט של השיחות התנהל מול GPT-3.5, וקצת יותר מרבע מול GPT-4. כל רשומה מייצגת שיחה שלמה וכוללת את חילופי הדברים, שפת השיחה, חותמת זמן, ומידע דמוגרפי כמו מדינה, אזור, גיבוב של כתובת IP ופרטי דפדפן מהבקשה.

בניגוד לסטים סינתטיים ומלוטשים, יש כאן תערובת של ניסוחים מעורפלים, מעברי נושא חדים, החלפת שפות באמצע השיחה ודיונים פוליטיים. הטקסטים עברו ניקוי להסרת פרטים מזהים באמצעות ספריית Presidio וכללים ידניים. בנוסף, גרסה זו נוקתה משיחות שסווגו כרעילות על ידי כלי הסינון של OpenAI או Detoxify, וכן נמחקו שיחות שהכילו מידע רגיש לפי מחקר שבדק שימוש של עיתונאים במערכות כאלה.

המאגר רב-לשוני ומכיל זיהוי של 68 שפות שונות, כאשר כל פנייה כוללת שדות ייעודיים לבדיקת רעילות, שפה והסרת מידע אישי. חלק מהשיחות מכיל שאילתות ריקות של משתמשים שהובילו לתשובות מהונדסות של המודל, תוצאה ישירה של ממשק הצ'אט שדרכו אספו את הנתונים ברשת.

מתאים ל

  • אימון הוראות למודלי שפה

    כוונון עדין על שיחות מגוונות שמכילות מעברי נושא ובקשות מעורפלות מהחיים האמיתיים.

  • חקר התנהגות משתמשים

    ניתוח דפוסי שימוש, מעבר בין שפות ובקשות נפוצות לפי אזורים גאוגרפיים שונים.

  • בדיקת חוסן לשיחות מורכבות

    הערכת ביצועי מודלים מול קלטים אמיתיים של בני אדם שאינם מנוסחים באופן מושלם.

איפה זה נופל

החוקרים מודים בתקלה שבה משתמשים שלחו הודעות ריקות, מה שגרם לבוט להזות תשובות בלי קלט. בנוסף, מדובר בסינון אגרסיבי של תוכן רעיל, כך שהדאטהסט לא מייצג את כלל ההתנהגויות באינטרנט. נכללו 68 שפות שונות, אך אין פירוט של נפח העברית, ולכן לא הייתי בונה עליו לשיפור מודלים בעברית בלי לסנן ולספור ידנית קודם. תהליך האנונימיזציה התבסס על כללים אוטומטיים וידניים, מה שעלול להשאיר שגיאות זיהוי או מחיקות יתר בטקסט.

אותה משפחה

WildChat יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לצרכים מסחריים?

הרישיון של המאגר עצמו הוא ODC-BY שדורש רק ייחוס, אך כל התשובות הופקו ישירות מ־ChatGPT. המשמעות היא שאתם כפופים גם לתנאי השימוש של OpenAI בנוגע לשימוש בפלט לאימון מודלים מסחריים.

איך נאספו השיחות האלה במקור?

החוקרים הקימו בוט ברשת שהציע למשתמשים גישה חופשית למודלים של GPT-3.5 ו־GPT-4. כל השיחות שנערכו מול הבוט נשמרו, לצד מטא-דאטה טכני שנאסף מהבקשות שלהם.

האם יש במאגר שיחות בעברית?

המאגר מזהה 68 שפות שונות לפי הניתוח שבוצע על השיחות, אך אין פירוט בכרטיס לכמות המדויקת של טקסטים בעברית. כדי לדעת אם זה מתאים לעבודה בעברית, תצטרכו לסנן את שדה השפה ולבדוק את ההיקף בפועל.

האם המאגר כולל תוכן פוגעני או רעיל?

גרסה זו נוקתה מכל שיחה שזוהתה כרעילה על ידי המערכות של OpenAI ו־Detoxify. מי שזקוק לנתונים הרעילים לצורכי מחקר בטיחות צריך להגיש בקשה נפרדת לקבלת הגרסה המלאה.

איך טוענים

המאגר יושב ב־15 קבצי Parquet שמחולקים לחלקים תחת תיקיית הנתונים הראשית, ללא צורך בהגשת בקשת אישור מיוחדת או המתנה לבדיקה. כל קובץ נטען בצורה תקנית באמצעות ספריית datasets הרגילה. לפני שרצים לאימון, צריך לשים לב שזיהוי השיחה אינו מפתח ייחודי מלא, וכדי לזהות סבב ספציפי יש להשתמש במזהה הייחודי של כל פנייה. שדות המפתח שחובה לסנן או לקרוא מראש הם מבנה השיחה המקונן, מודל המקור, ושפת השיחה, כדי להימנע מאימון על שאילתות ריקות או שיחות שלא מתאימות לשפת היעד שלכם.

from datasets import load_dataset

ds = load_dataset("allenai/WildChat-1M")

הרישיון

המאגר מופץ תחת רישיון ODC-BY שחל רטרואקטיבית על כל ההורדות. הרישיון דורש מתן קרדיט מתאים ליוצרים בכל שימוש או הפצה. הוא אינו כופה שיתוף באותו רישיון עבור תוצרים נגזרים, אך שימוש מסחרי במודלים שאומנו עליו כפוף גם לתנאי השימוש החיצוניים של OpenAI שמהם הופקו התשובות.

הרישיון המלא ב־Hugging Face ↗