GPT
P

persuasion

קוד פתוח

Anthropiccc-by-nc-sa-4.02024-03-30

המאגר מרכז טענות וטיעונים שנכתבו בידי בני אדם ומודלים, יחד עם ציוני שכנוע. הוא מתאים למי שרוצה למדוד כושר השפעה של טקסט מיוצר.

  • 904הורדות בחודש
  • 214לייקים

מה זה

הנתונים יושבים בקובץ persuasion_data.csv וכוללים בין אלף לעשרת אלפים רשומות. כל שורה מייצגת ניסוי שבו נבדק אנושי קרא טיעון שנכתב על טענה מסוימת, ודירג את עמדתו לפני הקריאה ואחריה. הטיעונים עצמם מגיעים משני מקורות, כותבים אנושיים או מודלי שפה שונים.

בתוך הרשומות מופיעים מזהה המשתתף, הטענה המקורית, הטיעון שנבדק, סוג הפרומפט ששימש ליצירתו, ומקור הטקסט שמציין שם מודל או אדם. הכרטיס לא מפרט תהליכי סינון, חלוקה מובנית לסט אימון ובדיקה, או פירוט על שיטת בחירת המשתתפים מעבר לעובדה שהם דירגו עמדות.

מתאים ל

  • הערכת כושר שכנוע במודלים

    השוואה בין יכולת ההשפעה של מודלי שפה שונים לבין כותבים אנושיים על סמך שינוי בעמדות הקוראים.

  • אימון מסווגי השפעה

    בניית מודל מחקרי שמדרג טקסט לפי פוטנציאל שינוי הדעה שהוא מייצר אצל הקורא.

  • ניתוח פרומפטים לשכנוע

    בדיקת הקשר בין סוג הפרומפט ששימש לייצור הטיעון לבין השינוי שחל בדירוג הסופי של המשתתף.

איפה זה נופל

כל הטקסטים במאגר הם באנגלית בלבד, ואין כאן אף מילה בעברית או התאמה לתרבות מקומית. הכרטיס לא מציין אילו מודלים בדיוק יצרו את הטיעונים, מיהם המשתתפים שדירגו, או מה היו הטענות שנבדקו. אם אתם בונים כלי למדידת שכנוע בעולם האמיתי, קחו בחשבון שהמדגם מבוסס כולו על ניסוי מבוקר וסגור בלי מידע על גיל הנתונים המדויק או הטיות הדוגמים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא, הרישיון הוא cc-by-nc-sa-4.0 שחוסם שימוש מסחרי באופן מוחלט. כל אימון, הערכה או תוצר שתפיקו מהנתונים מוגבלים לצורכי מחקר בלבד. בנוסף, כל עבודה נגזרת חייבת להיות מופצת תחת אותו רישיון מחמיר.

האם יש במאגר נתונים בעברית?

המאגר מוגדר לשפה האנגלית בלבד, ולא כולל נתונים בעברית. הטיעונים, הטענות ודירוגי המשתתפים נאספו כולם באנגלית. אם אתם צריכים לבדוק שכנוע בעברית, תצטרכו לתרגם את החומר או לאסוף מידע חדש.

כמה שוקל המאגר וכמה שורות יש בו?

המאגר מכיל בין אלף לעשרת אלפים רשומות ומורכב מקובץ CSV יחיד. הנפח שלו קטן מאוד ושוקל מגה-בייטים בודדים בלבד. אפשר להוריד אותו מיד למחשב מקומי בלי לחשוב על מגבלות זיכרון או שטח אחסון.

איך נאספו ציוני השכנוע בפועל?

משתתפים אנושיים קיבלו טענה ונתנו לה ציון עמדה ראשוני, ולאחר מכן קראו טיעון שנכתב על ידי אדם או מודל. בסיום הקריאה הם דירגו שוב את עמדתם באותו נושא. ההפרש בין שני הציונים משקף את מידת ההשפעה של הטיעון שנבדק.

איך טוענים

טוענים את המאגר ישירות עם load_dataset של Hugging Face תחת הנתיב Anthropic/persuasion. אין צורך לבקש אישור גישה מוקדם, והמאגר כולו פתוח להורדה. מדובר בקובץ CSV יחיד לצד תיעוד, כך שהמשקל זניח והטעינה מתבצעת תוך שניות בודדות. השדות שתרצו להתמקד בהם הם rating_initial ו־rating_final שמציגים את הפער בעמדת המשתתף, יחד עם עמודת source שמפרידה בין אדם למודלים.

from datasets import load_dataset

ds = load_dataset("Anthropic/persuasion")

הרישיון

הרישיון הוא cc-by-nc-sa-4.0, מה שאומר שאסור להשתמש בנתונים למטרות מסחריות כלל. אתם חייבים לתת קרדיט ליוצרים, ואם אתם משנים את הנתונים או בונים עליהם נגזרת, עליכם להפיץ אותה תחת אותו רישיון בדיוק. מודל שאומן על המאגר הזה מוגבל למחקר בלבד ולא תוכלו לשלב אותו במוצר רווחי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗