GPT
H

HC3-Chinese

קוד פתוח

Hello-SimpleAIcc-by-sa-4.02023-01-18

  • ChatGPT
  • SimpleAI
  • Detection
  • OOD

המאגר מרכז שאלות ותשובות מקבילות של בני אדם ושל צ'אט ג'יפיטי בסינית. הוא נבנה כדי להשוות בין מומחים אנושיים למודל שפה ולאמן גלאים לטקסט מכונה.

  • 1,785הורדות בחודש
  • 175לייקים

מה זה

הנתונים מחולקים לקובצי ג'ייסון לפי תחומים שונים, וכוללים בין עשרת אלפים למאה אלף רשומות בסך הכל. המבנה מבוסס על שאלות שנאספו ממקורות שונים ולצידן תשובות שנכתבו בידי מומחים אנושיים מול תשובות שנוצרו על ידי המודל, במטרה לבחון הבדלי סגנון ודיוק.

הקבצים במאגר מציגים חלוקה ממוקדת לפי נושאים מקצועיים. בין הקבצים תמצאו נתונים מעולם הרפואה, המשפט, הפיננסים, שאלות מתוך אנציקלופדיית באיקו, וכן משימות ממאגר השאלות והתשובות nlpcc_dbqa לצד קובץ שמרכז את כלל החומר. כרטיס המאגר לא מפרט את תהליכי הסינון המדויקים, אך הנתונים מיועדים להשוואה ישירה בין מקור אנושי לפלט בינה מלאכותית.

מתאים ל

  • אימון מסווג טקסט מכונה

    זיהוי הבדלים בין ניסוח של כותב אנושי לבין פלט מודל שפה בסינית על בסיס דוגמאות מקבילות.

  • בדיקת איכות תשובות מומחה

    הערכת היכולת של מודלים לענות על שאלות מקצועיות בתחומי המשפט והפיננסים בהשוואה לאדם.

  • מדידת דמיון סמנטי

    כיול מדדי דמיון בין ניסוחים שונים של תשובות נכונות לאותה שאלה באנציקלופדיה.

איפה זה נופל

הנתונים פורסמו בתחילת 2023 ומייצגים את הגרסאות הראשונות של צ'אט ג'יפיטי, כך שהם לא משקפים התנהגות של מודלים עדכניים. השפה השלטת היא סינית עם תיוג לאנגלית, ואין כאן מילה אחת בעברית.

כרטיס המאגר אינו מתעד שיטות ניקוי או בקרת איכות של התשובות האנושיות. אם אתם בונים מוצר לתחום רגיש כמו רפואה או משפט, אי אפשר להסתמך על אמינות התשובות בלי בדיקה ידנית מקיפה.

שאלות
נפוצות

האם המאגר כולל נתונים בעברית?

לא, המאגר מוגדר לשפות סינית ואנגלית בלבד, כשעיקר המידע והקבצים ממוקדים בסינית. אין בו שום טקסט בעברית, ולכן הוא לא מתאים לאימון ישיר עבור השוק המקומי אלא למחקר כללי על התנהגות מודלים.

האם מותר להשתמש במידע לפיתוח מוצר מסחרי?

הרישיון הבסיסי מאפשר זאת תחת שיתוף זהה, אך היוצרים מדגישים שחלק ממקורות המידע החיצוניים מחזיקים ברישיונות מחמירים יותר. אם אתם מתכננים מוצר מסחרי, תצטרכו להתחקות אחר המקור של כל קובץ כדי לוודא שאין מניעה חוקית לשימוש בו.

כמה רשומות יש בדאטהסט ואיך הוא בנוי?

היקף הנתונים עומד על בין עשרת אלפים למאה אלף רשומות שמחולקות לקובצי jsonl לפי נושאים. כל רשומה כוללת שאלה לצד תשובה שנכתבה על ידי אדם ותשובה שנוצרה על ידי המודל להשוואה ישירה.

איך נאספו התשובות והשאלות?

השאלות נלקחו ממאגרים קיימים כמו אנציקלופדיית באיקו ומאגר השאלות והתשובות nlpcc_dbqa, לצד נתונים מקצועיים ברפואה ומשפטים. לאחר מכן נאספו תשובות אנושיות והופקו תשובות מקבילות באמצעות צ'אט ג'יפיטי לצורך יצירת זוגות השוואה.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטס באמצעות המזהה Hello-SimpleAI/HC3-Chinese, או מורידים את קובצי ה־jsonl הייעודיים. הגישה פתוחה לחלוטין ואינה דורשת אישור ידני מהיוצרים.

לפני הטעינה כדאי להחליט אם מושכים את הקובץ המלא או מתמקדים בקובץ לפי תחום ספציפי כמו רפואה או משפטים. המאגר כולל 11 קבצים, והשדות העיקריים שבהם תעבדו עוסקים בטקסט השאלה, בתשובת האדם ובתשובת המודל עבור משימות סיווג ודמיון סמנטי.

from datasets import load_dataset

ds = load_dataset("Hello-SimpleAI/HC3-Chinese")

הרישיון

הרישיון הרשמי הוא cc-by-sa-4.0 שמחייב ייחוס ושיתוף תחת אותם תנאים, אך היוצרים מציינים סייג חשוב. אם מאגרי המקור שמתוכם נאספו השאלות כפופים לרישיון מחמיר יותר, המגבלות שלהם חלות גם כאן. המשמעות היא ששימוש מסחרי או שחרור מודל שאומן על החומר דורשים בדיקה נפרדת של מקורות המידע המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗