GPT
K

korean_safe_conversation

קוד פתוח

jojo0217apache-2.02024-04-27

מאגר שיחות יומיומי בקוריאנית שנועד ללמד מודלים להתנסח בצורה בטוחה וללא הטיות. הוא כולל כמעט 27 אלף דוגמאות שעברו בדיקה אנושית וסינון של ביטויי שנאה.

  • 228הורדות בחודש
  • 58לייקים

מה זה

המאגר מיועד לאימון צ'אטבוטים בקוריאנית לשיחה חופשית תוך שמירה על כללי אתיקה. הוא נבנה במסגרת שיתוף פעולה בין אוניברסיטת סונגקיונקוואן וחברת VAIV, ורובו עבר ביקורת אנושית ידנית לצד שימוש ב־GPT-3.5 ו־GPT-4 ליצירה ולתרגום.

בסך הכל יש כאן 26,979 רשומות שמחולקות לפי מקורות בתוך תיקיית raw. הנתח הגדול ביותר, 19,955 רשומות, מגיע מגרסה מסוננת ומנוקה מרעשים של KoAlpaca 1.1. שאר הדאטה כולל 2,063 שיחות יומיות ממאגר לאומי קוריאני, 1,020 שיחות רגשיות ו־1,126 דוגמאות לטיפול בביטויי שנאה מ־AIHub, כ־1,300 שיחות מתורגמות ממאגר RLHF של Yitingxie, 1,039 דוגמאות בדיקת הטיות מ־Naver SQuARe, ועוד 476 הוראות שנוצרו בשיטת Evol-instruct.

מתאים ל

  • אימון צ'אטבוט בקוריאנית

    כוונון עדין של מודלי שפה כדי לנהל שיחות חולין בקוריאנית עם שפה טבעית.

  • סינון ביטויי שנאה

    לימוד מודלים לזהות ולעקוף תגובות פוגעניות או מוטות באמצעות דוגמאות הבטיחות שבמאגר.

  • הערכת בטיחות שיחה

    שימוש ברשומות מ־Naver SQuARe לבדיקת רמת ההטיה והתגובות של מודלים קיימים.

איפה זה נופל

הדאטהסט מוגבל לקוריאנית בלבד. אין כאן מילה בעברית או באנגלית, למעט תרגומים סינתטיים שנכנסו פנימה דרך מודלים של OpenAI. בנוסף, מתוך כמעט 27 אלף דוגמאות, כמעט 20 אלף מגיעות ממקור יחיד של KoAlpaca, כך שהאיזון בין שיחה חופשית כללית לבין דוגמאות הבטיחות והרגש אינו שווה. שילוב תרגומים אוטומטיים מ־GPT מחייב אתכם לבדוק את התחביר לפני שמכניסים אותו למודל סופי.

שאלות
נפוצות

האם הדאטהסט כולל עברית?

לא. המאגר מכיל שיחות בקוריאנית בלבד. אין בו שום ייצוג לעברית או לשפות אחרות, למעט חלקים שתורגמו מקורית מאנגלית לקוריאנית.

האם מותר להשתמש בו למוצר מסחרי?

דף המאגר מוגדר תחת רישיון apache-2.0, שבאופן עקרוני מתיר שימוש מסחרי מלא. עם זאת, הדאטהסט מאחד נתונים ממקורות חיצוניים כמו AIHub ופרויקטים של Naver, ולכן כדאי לבדוק שתנאי השימוש של נתוני המקור אינם מתנגשים עם המטרה שלכם.

איך הנתונים נאספו ונבדקו?

החוקרים שילבו מאגרי שיחה קוריאניים ציבוריים, דוגמאות מ־KoAlpaca ותרגומים שיצרו באמצעות GPT-3.5 ו־GPT-4. לפי התיעוד שלהם, רוב החומר עבר ביקורת אנושית ידנית במטרה לנקות רעשים ולסנן ביטויי שנאה ותשובות מוטות.

כמה דוגמאות יש במאגר ואיך ניגשים אליהן?

יש בסך הכל 26,979 שורות. הנתונים לא מגיעים כטבלה אחת אלא מחולקים לקובצי jsonl שונים בתוך תיקיית raw, ולכן תצטרכו לטעון את הקבצים הרלוונטיים ישירות משם.

איך טוענים

הנתונים נמצאים ישירות במאגר Hugging Face ואינם דורשים הרשאה מיוחדת כדי לגשת אליהם. במקום קובץ מאוחד אחד, הנתונים יושבים בתוך תיקיית raw בקובצי jsonl נפרדים לפי סוג המקור, כמו conversation.jsonl, evol.jsonl וקובץ KoAlpaca המסונן. כדי לאמן מודל תצטרכו להוריד את הקבצים, לבדוק את מבנה השדות בכל קובץ jsonl ולאחד אותם לפורמט הרצוי לכם.

from datasets import load_dataset

ds = load_dataset("jojo0217/korean_safe_conversation")

הרישיון

המאגר מפורסם ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשחרר את המודל שלכם באותו רישיון, כל עוד אתם שומרים על הודעת זכויות היוצרים והייחוס המקורי. עם זאת, מכיוון שהנתונים נאספו ממקורות חיצוניים שונים כמו AIHub ו־Naver, מומלץ לוודא שהתנאים של אותם מאגרי מקור אינם מגבילים את אופן השימוש שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗