GPT
W

WildChat-4.8M

קוד פתוח

allenaiodc-by2025-08-08

  • instruction-finetuning

מיליוני שיחות אמיתיות בין אנשים ל־ChatGPT מסוננות מתוכן רעיל ומסודרות לפי מודלים ושפות. זה מאגר שמשקף איך אנשים באמת מדברים עם בוטים, כולל מודלי החשיבה החדשים.

  • 7,465הורדות בחודש
  • 191לייקים

מה זה

המאגר מכיל 3,199,860 שיחות מלאות שנאספו ממשתמשים אנושיים שפנו לשירותי ChatGPT דרך ממשק צ'אט ייעודי. מדובר בגרסה נקייה שמתוכה נופו 1,543,476 שיחות שנמצאו רעילות על ידי מודלי הסינון של OpenAI ו־Detoxify, וכן הוסרו ממנה שיחות שזוהו ככאלו שהגיעו מקטינים.

כל רשומה מייצגת שיחה שלמה וכוללת מערך של כל חילופי הדברים, תאריכים, המודל הספציפי שייצר את המענה, שפת השיחה, מטא-דאטה של הבקשות, ומזהה IP מוצפן שממנו נגזרו ארץ ומחוז. החוקרים הפעילו כלי אנונימיזציה כמו Microsoft Presidio וסריקות TruffleHog כדי למחוק פרטים אישיים ומפתחות API.

רוב השיחות נוצרו מול gpt-4o עם 1,539,780 שיחות, ולאחריו gpt-3.5-turbo ו־gpt-4.1-mini. יש כאן גם 111,836 שיחות ממודלי החשיבה o1-preview ו־o1-mini, מה שמאפשר לבחון אינטראקציות סביב בעיות מורכבות יותר.

מתאים ל

  • אימון מודלי שיחה

    כוונון עדין של מודלים על אינטראקציות אותנטיות של משתמשים, החל מניסוחים מעורפלים ועד חילופי שפות.

  • ניתוח התנהגות o1

    חקר שיחות מבוססות מודלי חשיבה כדי לבחון איך אנשים נעזרים ביכולות היסק בבעיות מורכבות.

  • בדיקת סינון ובטיחות

    הערכת תגובות של מודלים לפניות רגישות באמצעות מטא-דאטה מובנה של בקרת תוכן.

איפה זה נופל

ממשק האיסוף אפשר למשתמשים לשלוח הודעות ריקות, מה שגרם למודלים להזות תשובות בלי פרומפט מקדים, והמקרים האלה מופיעים בטקסט. המאגר נסגר בנתונים שנאספו עד סוף יולי 2025 ולא כולל אינטראקציות מאוחרות יותר. בנוסף, חלוקת השפות אינה מאוזנת ואף שהמאגר מכסה עשרות שפות, רוב התוכן מרוכז סביב שפות מרכזיות, כך שביצועים בעברית דורשים בדיקה מדגמית מוקדמת לפני שימוש לאימון.

אותה משפחה

WildChat יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר מותר לשימוש מסחרי?

כן, רישיון ODC-By מאפשר שימוש מסחרי, כולל אימון מודלים והפצת תוצרים. החובה המרכזית היא מתן ייחוס מתאים לחוקרים שיצרו את המאגר.

האם יש במאגר שיחות בעברית?

המאגר מזהה עשרות שפות שונות ברמת התור והשיחה, כולל עשרות שפות שתועדו בפרסומים קודמים. עברית קיימת אם משתמשים פנו בעברית, אך כדאי לסנן מראש לפי שדה ה־language כדי לראות את הנפח המדויק.

איך הנתונים נאספו?

המידע נאסף מאינטראקציות של משתמשים אמיתיים עם בוט ייעודי שסיפק גישה למודלים שונים של חברת OpenAI. לאחר מכן החוקרים ניקו תוכן רעיל, הסירו שיחות של קטינים, ומחקו מידע מזהה ומפתחות אבטחה.

מה ההבדל בין גרסה זו לגרסת ה־Full?

גרסת ה־Full נעולה מאחורי טופס בקשה מיוחד ומכילה שיחות שסווגו כרעילות על ידי כלי הניטור. הגרסה הזו פתוחה לגמרי ומכילה אך ורק שיחות נקיות שעברו את מנגנוני הסינון.

איך טוענים

הנתונים מחולקים ל־87 קובצי Parquet שונים שממוספרים מ־00000 עד 00086 בתוך תיקיית המידע. אין צורך בבקשת גישה מיוחדת, הגרסה הזו פתוחה להורדה ישירה דרך Hugging Face בניגוד לגרסה המלאה שדורשת אישור ידני. מומלץ לעבוד עם שדות ה־conversation ישירות ולסנן לפי language ו־model כדי לא להעמיס את הזיכרון, שכן המאגר מכיל מיליוני רשומות מרובות תורות.

from datasets import load_dataset

ds = load_dataset("allenai/WildChat-4.8M")

הרישיון

המאגר מופץ תחת רישיון ODC-By. מותר להשתמש בו, לבצע התאמות ולאמן מודלים, כולל למטרות מסחריות, כל עוד נותנים קרדיט מתאים ליוצרים לפי דרישות הרישיון. אין חובה לשתף נגזרות תחת אותו רישיון בדיוק.

הרישיון המלא ב־Hugging Face ↗