GPT
T

ThoughtTrace

קוד פתוח

SCAI-JHUcc-by-4.02026-05-13

  • human-ai-interaction
  • user-thoughts
  • latent-intent
  • multi-turn-dialogue
  • user-modeling

המאגר מחבר שיחות מרובות תורות עם מודלי שפה למחשבות שהמשתמשים דיווחו עליהן בזמן אמת. הוא מיועד למי שרוצה להבין מה מניע את המשתמש ולא רק מה נכתב בטקסט.

  • 3,938הורדות בחודש
  • 23לייקים

מה זה

הנתונים מורכבים משיחות מרובות תורות שניהלו 1,058 משתתפים מול 20 מודלי שפה שונים סביב משימות יומיומיות פתוחות. כל רשומה מייצגת שיחה אחת כזו, כאשר חלק מהמשתתפים ביצעו כמה שיחות לאורך משימה אחת או יותר. סך הכל יש כאן 2,155 שיחות ובהן 10,174 הערות מחשבה מתועדות שמחוברות להודעות ספציפיות.

המחשבות עצמן מחולקות לשני סוגים ברורים. הסוג הראשון הוא סיבות, שמוצמדות להודעות של המשתמש ומפרטות את המוטיבציה, ההקשר הקודם, הציפיות או המגבלות שהובילו לניסוח הפרומפט, תחת שבע קטגוריות שונות. הסוג השני הוא תגובות, שמוצמדות לתשובות המודל ומתעדות את התחושה הפנימית של המשתמש, החל מאישור מפורש ועד תסכול או חוסר שביעות רצון מרלוונטיות התוכן, סגנון ההצגה והיקף המענה בחמש קטגוריות.

מתאים ל

  • סימולציית משתמשים

    אימון סוכנים שמסוגלים לחזות את המחשבה הבאה ואת הפרומפט הבא של המשתמש.

  • יישור מודלים והתאמה

    שימוש בתגובות הפנימיות של המשתמשים כאותות העדפה מפורטים לשיפור התשובות.

  • מבחני הערכה

    בדיקת היכולת של מודלים לחלץ מטרות נסתרות ותגובות מתוך הקשר השיחה לבדו.

איפה זה נופל

הנתונים מוגבלים לחלוטין לשפה האנגלית, כך שאין שום ייצוג לעברית או לדפוסי שיחה מקומיים. המאגר נשען על דיווח עצמי של משתתפים בניסוי מוגדר, מה שעלול לייצר הטיה באופן שבו אנשים מנסחים את המחשבות שלהם מול מודל. בנוסף, מדובר בהיקף של 2,155 שיחות בלבד, גודל שלא יספיק לאימון מודל בסיס מאפס אלא בעיקר לכיוונון עדין או להערכה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא cc-by-4.0 ומאפשר שימוש מסחרי מלא. התנאי המרכזי הוא מתן ייחוס ליוצרים לפי דרישות הרישיון. מודלים שתאמנו על הנתונים אינם מחויבים ברישיון פתוח.

האם הדאטהסט כולל שיחות בעברית?

לא, המאגר מסומן וכולל שיחות בשפה האנגלית בלבד. אם המוצר שלכם פונה לקהל ישראלי, תצטרכו לתרגם את הנתונים או לבחון התאמה עצמאית. תבניות המחשבה משקפות אינטראקציות באנגלית.

איך נאספו הנתונים?

המידע נאסף מ־1,058 משתתפים שביצעו משימות יומיומיות פתוחות מול 20 מודלי שפה שונים. המשתמשים דיווחו בעצמם על הסיבות לכתיבת הפרומפטים ועל התגובות שלהם לתשובות שקיבלו. סך הכל תועדו 10,174 הערות מחשבה ב־2,155 שיחות.

במה הוא שונה ממאגרי שיחות רגילים?

רוב המאגרים כוללים רק את הטקסט הגלוי שהוחלף בין הצדדים. המאגר הזה מתעד גם את מה שהמשתמש חשב ולא כתב, כולל המטרות שלו ומידת שביעות הרצון מהתשובה. הנתונים האלה מספקים שכבת מידע שלא קיימת בשיחות סטנדרטיות.

איך טוענים

הקובץ המרכזי מגיע בפורמט ThoughtTrace.jsonl ואין צורך בבקשת גישה מיוחדת להורדה. מדובר במאגר קטן יחסית של כמה אלפי שיחות בלבד, כך שטעינה ישירה בפייתון לא דורשת משאבי חישוב כבדים או זיכרון מיוחד. בכל רשומה חשוב לחלץ את רצף השיחה, את מזהה המודל מתוך 20 המודלים שנבדקו, ואת מערך המחשבות שמוצמד לכל הודעה כדי להבדיל בין הסיבות של המשתמש לתגובות שלו.

from datasets import load_dataset

ds = load_dataset("SCAI-JHU/ThoughtTrace")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, כולל אימון מודלים עליהם. הדרישה היחידה היא מתן קרדיט וייחוס הולם ליוצרים המקוריים, ואין חובה לשתף נגזרות תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗