GPT
P

PersonaMem-v1

קוד פתוח

bowen-upennmit2025-04-09

  • personalization
  • preference
  • chatbot
  • memory
  • long-context

המאגר מכיל דיאלוגים רב-שלביים ארוכים ושאלות שבודקות אם מודל זוכר פרטי משתמש ושינויי העדפות לאורך זמן. הוא נועד למדוד פרסונליזציה וזיכרון ארוך טווח בצ'אטבוטים.

  • 4,390הורדות בחודש
  • 15לייקים

מה זה

הנתונים מחולקים לפי שלושה אורכי הקשר: 32 אלף טוקנים, 128 אלף טוקנים ומיליון טוקנים. בכל חלוקה יש זוג קבצים. קובץ הדיאלוגים מורכב מרשימות של היסטוריית שיחות בין משתמש למודל, וקובץ השאלות מכיל שאילתות ספציפיות שבוחנות שבעה כישורי זיכרון, יחד עם התשובה הנכונה ואפשרויות הבחירה.

כל רשומה מייצגת פרופיל משתמש הכולל מאפיינים קבועים, כמו נתונים דמוגרפיים, לצד העדפות דינמיות שמשתנות מסשן לסשן. השיחות עצמן עוסקות בנושאים כמו המלצות על אוכל, תכנון טיולים וייעוץ, והן נוצרו באמצעות תהליך יצירת דיאלוג סינתטי שמדמה שינויי הקשר מציאותיים על פני זמן.

מתאים ל

  • מבחן זיכרון ארוך טווח

    בדיקת יכולת המודל לאתר עובדות ושינויי העדפות בתוך הקשר של עד מיליון טוקנים.

  • הערכת צ'אטבוט מותאם אישית

    מדידת הדיוק של מודל שיחה במתן המלצות שמתאימות להיסטוריה של המשתמש.

  • ניתוח מעקב אחרי העדפות

    הערכה כמותית של יכולת המערכת לעקוב אחרי הסיבות לשינוי בטעמו של הלקוח.

איפה זה נופל

כל השיחות במאגר נוצרו בצורה סינתטית ולא מול משתמשים אמיתיים, מה שאומר שהניסוחים והתנהגות המשתמשים עלולים להרגיש מלאכותיים. בנוסף, המאגר כולו באנגלית בלבד. אם אתם בונים מוצר שמיועד לעברית או מבוסס על סלנג מקומי, הנתונים האלה לא יספקו לכם תמונה אמיתית לגבי ביצועי המודל.

אותה משפחה

PersonaMem יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון MIT מתיר שימוש מסחרי מלא, כולל אימון מודלים ובדיקת מערכות פנימיות, כל עוד מצרפים את הצהרת הרישיון המקורית.

האם המאגר כולל נתונים בעברית?

לא. כל הדיאלוגים והשאלות במאגר נכתבו באנגלית בלבד.

מאיפה הנתונים הגיעו והאם מדובר בשיחות של אנשים אמיתיים?

השיחות לא נאספו ממשתמשים אנושיים אלא נוצרו באופן סינתטי. החוקרים השתמשו בתהליך יצירה אוטומטי כדי לדמות פרופילי משתמש והעדפות שמשתנות לאורך מספר שיחות.

באילו אורכי הקשר אפשר לבחון את המודלים?

הנתונים מחולקים לשלושה גדלים של חלונות הקשר: 32 אלף, 128 אלף, ומיליון טוקנים. זה מאפשר לבדוק את עמידות המודל באורכי טקסט שונים.

איך טוענים

המאגר פתוח להורדה ישירה דרך Hugging Face ללא צורך באישור גישה. כדי להריץ הערכה בפועל צריך לקרוא את קובץ ה־CSV המכיל את השאלות, ולהצליב אותו עם קובץ ה־JSONL המקביל שמחזיק את היסטוריית השיחה המלאה. החיבור מתבצע באמצעות השדה שמזהה את ההקשר המשותף, יחד עם שדה האינדקס שקובע איפה לחתוך את השיחה עבור כל שאלה.

from datasets import load_dataset

ds = load_dataset("bowen-upenn/PersonaMem-v1")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי, הפצה ואימון של מודלים ללא דרישה לשתף את הקוד תחת אותו רישיון. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗