GPT
W

WildChat

קוד פתוח

allenaiodc-by2023-10-27

  • instruction-finetuning

המאגר מרכז כ־650 אלף שיחות אמיתיות של משתמשים עם ChatGPT ברשת. הוא מיועד למי שרוצה נתוני אימון מגוונים מהשטח ולא שיחות סינתטיות שנכתבו במעבדה.

  • 4,404הורדות בחודש
  • 209לייקים

מה זה

הנתונים מבוססים על שיחות חיות בין בני אדם למודלים של OpenAI, בעיקר GPT-3.5 ו־GPT-4. החוקרים הציעו למשתמשים גישה חופשית למודלים דרך צ'אטבוט ייעודי, וכך אספו אינטראקציות אמיתיות שכוללות שאלות מעורפלות, החלפת שפות באמצע שיחה, מעבר בין נושאים ודיונים פוליטיים. הטקסט כולל 66 שפות שונות שזוהו במהלך השימוש.

המאגר עבר כמה סבבי סינון ידניים ואוטומטיים. החוקרים הפעילו את Microsoft Presidio וחוקים שכתבו בעצמם כדי לזהות ולמחוק פרטי זיהוי אישיים ומידע רגיש. בנוסף, כל השיחות שסומנו כרעילות על ידי כלי הסינון של OpenAI או Detoxify הוסרו מהגרסה הנוכחית, כך שנשארו רק תכנים שהוגדרו נקיים.

מתאים ל

  • כוונון מודלים להוראות

    אימון מודלי שפה על שיחות משתמשים אמיתיות עם ניסוחים טבעיים ומורכבים.

  • מחקר התנהגות משתמשים

    ניתוח האופן שבו בני אדם שואלים שאלות, מחליפים שפות ונושאים מול צ'אטבוטים.

  • בדיקת תגובות להודעות ריקות

    איתור וחקירה של הזיות מודל הנובעות מקלט חסר של משתמשים.

איפה זה נופל

באיסוף המקורי הייתה תקלה בצ'אטבוט שאפשרה שליחת הודעות ריקות, מה שגרם למודל לייצר הזיות ללא שאלת משתמש ב־12,405 שיחות מתוך 652,139. תצטרכו לסנן אותן עצמאית כדי לא ללכלך את האימון. בנוסף, חלוקת 66 השפות לא מפורטת בכרטיס ולא ידוע כמה עברית יש שם בפועל. יש גם לקחת בחשבון שקיימת כבר גרסה חדשה ומורחבת יותר של הפרויקט עם 4.8 מיליון שיחות.

אותה משפחה

WildChat יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון ODC-BY מאפשר שימוש מסחרי בפיתוח מודלים ומוצרים. התנאי המרכזי הוא מתן ייחוס וקרדיט ליוצרי המאגר לפי הדרישות ברישיון.

האם המאגר כולל שיחות בעברית?

במאגר זוהו 66 שפות שונות, אך הכרטיס אינו מפרט את אחוז השיחות בעברית מתוך 650 אלף הרשומות. מומלץ לבצע סינון לפי שדה השפה לפני שמתחילים לאמן.

איך המידע נאסף בפועל?

החוקרים הקימו ממשק צ'אטבוט ברשת והציעו לציבור גישה חינמית למודלים GPT-3.5 ו־GPT-4 של OpenAI. כל השיחות שנאספו בממשק נשמרו, נוקו ממידע רגיש ותוכן רעיל, ואז פורסמו.

מה ההבדל בין מאגר זה לגרסת ה־4.8M של WildChat?

גרסה זו מכילה כ־650 אלף שיחות ראשונות שנאספו ונוקו מרעילות. ליוצרים יש גרסה חדשה ומורחבת יותר שמכילה 4.8 מיליון שיחות וכוללת גם מידע דמוגרפי.

איך טוענים

טעינת המאגר מתבצעת ישירות דרך ספריית datasets משישה קבצי Parquet שמחולקים לחלק train בלבד. אין צורך באישור גישה מוקדם או בהרשמה מיוחדת. בכל רשומה חשוב לשים לב לשדה conversation שמכיל את רצף ההודעות, תפקיד הדובר והשפה, ולשדות toxic ו־redacted שמסמנים האם הוסר מידע רגיש מהשיחה.

from datasets import load_dataset

ds = load_dataset("allenai/WildChat")

הרישיון

המאגר מופץ תחת רישיון ODC-BY, שחל רטרואקטיבית גם על הורדות ישנות. הרישיון מאפשר שימוש מסחרי ומחקר חופשי, בלי דרישה לשתף את המודל או הנגזרות באותו רישיון, בתנאי שנותנים ייחוס הולם ליוצרים ומצרפים את הקרדיט המבוקש.

הרישיון המלא ב־Hugging Face ↗