GPT
H

HC3

קוד פתוח

Hello-SimpleAIcc-by-sa-4.02023-01-18

  • ChatGPT
  • SimpleAI
  • Detection
  • OOD

המאגר מרכז שאלות לצד תשובות שנכתבו בידי אדם ותשובות מקבילות מ־ChatGPT. הוא מיועד בעיקר למי שרוצה לאמן מודלים לזיהוי טקסט שנוצר בידי מכונה או להשוות סגנונות כתיבה.

  • 8,662הורדות בחודש
  • 222לייקים

מה זה

הנתונים מחולקים למספר קבצי JSONL לפי תחומים ספציפיים, לצד קובץ מאוחד שמכיל את כלל הדוגמאות. אפשר למצוא שם חלוקה לרפואה, פיננסים, שאלות ותשובות פתוחות, נתונים מקהילת Reddit בפורמט של הסבר פשוט, וטקסטים בנושאי מחשב מתוך ויקיפדיה. כל רשומה כוללת את השאלה המקורית ואת שני סוגי המענה, האנושי והממוחשב, כדי לאפשר השוואה ישירה ביניהם.

המפתחים אספו את החומרים ממקורות מידע קיימים באינטרנט ובקהילות תוכן שונות, ולאחר מכן הפיקו את התשובות התואמות דרך ChatGPT. הכרטיס אינו מפרט את הליכי הסינון המדויקים או את שיטות הניקוי שבוצעו על הטקסטים לפני פרסומם, כך שרמת העריכה מעבר לצימוד השאלות והתשובות אינה מצוינת.

מתאים ל

  • זיהוי טקסט מכונה

    אימון מסווגים שמבדילים בין ניסוח אנושי לתשובות שנוצרו על ידי מודלי שפה.

  • מחקרי סגנון כתיבה

    השוואה כמותית בין אופן המענה של מומחה אנושי לבין התשובות הממוחשבות בתחומים שונים.

  • הערכת מערכות שאלות ותשובות

    בדיקת איכות של מענה לשאלות מורכבות בתחומי רפואה וכלכלה.

איפה זה נופל

הטקסטים מוגבלים לאנגלית ולסינית בלבד, ואין כאן נתונים בעברית. הנתונים פורסמו בתחילת 2023, סמוך מאוד להשקת ChatGPT, ולכן התשובות מייצגות גרסה מוקדמת שלו ולא מודלים עדכניים יותר. בנוסף, הכרטיס לא מפרט אילו הטיות נבדקו בטקסטים שנאספו מרדיט או מוויקיפדיה, ומחייב בדיקה עצמאית של איכות התוכן האנושי לפני שימוש בו כבסיס עובדתי מהימן.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. המאגר כולל טקסטים באנגלית ובסינית בלבד.

האם מותר להשתמש בו לפרויקט מסחרי סגור?

רישיון cc-by-sa-4.0 מחייב שיתוף של תוצרים נגזרים באותו רישיון חופשי. בנוסף, המפתחים מדגישים שאם לחלק מהמקורות המקוריים היו תנאים מגבילים יותר, הם חלים גם כאן, ולכן שימוש בקוד סגור בעייתי.

איזה סוג של מידע נמצא בכל רשומה?

הרשומות מכילות שאלה מוגדרת לצד תשובה שנאספה מאדם ותשובה מקבילה שהופקה מ־ChatGPT. המידע מחולק לנושאים כמו רפואה, פיננסים, מדע ושיחות פתוחות.

איך טוענים

טוענים את המאגר ישירות עם מזהה החבילה של Hello-SimpleAI דרך ספריית הדאטהסטים הרגילה, בלי צורך בבקשת גישה מיוחדת או באישור ידני. הקבצים שמורים בפורמט JSONL, כך שאפשר גם להוריד ולפתוח ישירות את התחום שמעניין אתכם, למשל קובץ הרפואה או הפיננסים, מבלי לטעון את כל עשרות אלפי הרשומות בבת אחת.

from datasets import load_dataset

ds = load_dataset("Hello-SimpleAI/HC3")

הרישיון

הרישיון המדווח הוא cc-by-sa-4.0, שדורש מתן קרדיט ושיתוף יצירות נגזרות תחת אותו רישיון. המשמעות היא שאם אתם מאמנים עליו מודל או בונים נגזרת, תצטרכו לשחרר אותם באותם תנאים. כמו כן, המפתחים מציינים שאם מקורות המידע המקוריים השתמשו ברישיונות מחמירים יותר, התנאים המחמירים הם אלה שקובעים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗