GPT
T

toxic-chat

קוד פתוח

lmsyscc-by-nc-4.02023-10-26

עשרת אלפים פרומפטים אמיתיים של משתמשים מדמו הרשת של ויקוניה, עם תיוגי רעילות וניסיונות פריצה. זה מראה בדיוק איך אנשים מדברים בפועל עם מודלים כשאף אחד לא מסתכל עליהם.

  • 10,046הורדות בחודש
  • 201לייקים

מה זה

המאגר מכיל 10,165 פרומפטים שנאספו ישירות מתוך הדמו המקוון של Vicuna. בניגוד לטקסטים מוויקיפדיה או מרשתות חברתיות, מדובר באינטראקציות ישירות בין אדם למודל שיחה, מה שהופך את דפוסי הרעילות לשונים מהרגיל. התיוג בוצע בשילוב של מודלים ובני אדם, כאשר 5,654 מהרשומות בגרסה העדכנית עברו תיוג אנושי כדי לשמור על דיוק לצד היקף עבודה סביר.

בנתונים קיימות שתי גרסאות שמסומנות לפי חודש העדכון שלהן, נובמבר 2023 וינואר 2024. הגרסה השנייה תקנה שגיאות תיוג קודמות והוסיפה עוד 20 דוגמאות אנושיות. רק כ־7.33% מהפרומפטים סווגו כרעילים וכ־2.01% הוגדרו כניסיונות עקיפת מגבלות (jailbreaking). המאגר מחולק לקובצי אימון ומבחן בפורמט טבלאי נוח לשימוש.

מתאים ל

  • אימון מסנני רעילות

    אימון וכיול של מודלי סיווג שמזהים קללות, שנאה ותוכן פוגעני בפרומפטים שנשלחים למערכות AI.

  • זיהוי ניסיונות עקיפה

    זיהוי פרומפטים שמנסים לגרום למודל לחרוג מכללי הבטיחות שלו (jailbreak) בזמן אמת.

  • בנצ'מרק למערכות סינון

    הערכת הביצועים של מסננים מסחריים מול שיחות אמת של משתמשים עם מודל ויקוניה.

איפה זה נופל

הנתונים מבוססים על אנגלית בלבד. אם המוצר שלכם פונה לקהל ישראלי ודורש זיהוי רעילות בעברית, המאגר הזה לא ייתן לכם מענה ישיר. מעבר לכך, יש פה הטיה חזקה של חוסר איזון, כשרק קצת מעל שבעה אחוזים מהדוגמאות הן רעילות, וניסיונות הפריצה מהווים כשני אחוזים בלבד מהסך הכולל. צוות הפרויקט גם מזהיר שלמרות ניקוי זהויות ידני, ייתכן שנותר מידע אישי של משתמשים בפרומפטים המקוריים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון הוא CC-BY-NC-4.0 שאוסר שימוש מסחרי מכל סוג. הוא מיועד למחקר, ניסויים אקדמיים ובדיקות פנימיות בלבד. אם תאמנו עליו מודל, לא תוכלו לשלב אותו במוצר שמייצר הכנסה.

האם הדאטהסט כולל טקסטים בעברית?

לא, כל הפרומפטים שנאספו בדמו של ויקוניה ומתוייגים במאגר הם בשפה האנגלית. כדי לאמן מודלים לזיהוי רעילות בעברית, תצטרכו לחפש מאגרים מקומיים או לתרגם ולהתאים את הדוגמאות בעצמכם.

איזו גרסה של המאגר כדאי להוריד?

עדיף להשתמש בגרסת toxicchat0124 שפורסמה בינואר 2024. גרסה זו כוללת תיקוני תיוג ידניים של טעויות שנמצאו בגרסה הראשונית, ונוספו בה עוד 20 דוגמאות שתויגו על ידי בני אדם.

איך נאספו הנתונים ומי תייג אותם?

הפרומפטים הגיעו ממשתמשים אנונימיים שדיברו עם מודל Vicuna ברשת. התיוג בוצע במודל היברידי, שילוב של סיווג אוטומטי ובדיקה אנושית של למעלה ממחצית מהרשומות כדי לאתר רעילות ועקיפות.

איך טוענים

טוענים את המאגר ישירות בספריית datasets של Hugging Face עם הפקודה load_dataset, כשמומלץ לציין מפורשות את התצורה toxicchat0124 כדי לעבוד עם הגרסה העדכנית והמתוקנת. אין צורך לבקש אישור גישה מראש או להמתין למפתח. הקבצים שמורים בפורמט CSV, הכוללים חלוקה מובנית לקובצי train ו־test לצד קובץ מאוחד. השדות הקריטיים לעבודה הם טקסט הפרומפט המקורי של המשתמש, ותגיות הסיווג לרעילות ולניסיונות פריצה, מה שמאפשר לבנות מודל סיווג טקסט סטנדרטי בלי שלבי הכנה מסובכים.

from datasets import load_dataset

ds = load_dataset("lmsys/toxic-chat")

הרישיון

הרישיון כאן הוא CC-BY-NC-4.0 עבור הפרומפטים והפלטים כאחד. המשמעות ברורה וחדה, השימוש מוגבל למטרות מחקר ולימוד בלבד, וחל איסור מוחלט על שימוש מסחרי. לא תוכלו להטמיע מודל שאומן על הדאטה הזה בתוך מוצר שנמכר ללקוחות, ואתם מחויבים לתת קרדיט מלא ליוצרים בכל פרסום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗