GPT
P

PersonaMem-v2

קוד פתוח

bowen-upenncc-by-4.02025-08-20

  • personalization
  • memory
  • long-context

המאגר מכיל שיחות ארוכות שנועדו לבחון אם מודלים מזהים העדפות סמויות של משתמשים. הוא כולל פרסונות סינתטיות עם חלונות הקשר גדולים, הן לטקסט והן למשימות מולטימודליות.

  • 10,223הורדות בחודש
  • 37לייקים

מה זה

הנתונים בנויים סביב 1,000 פרסונות שונות וכוללים 26,100 העדפות, קטעי שיחה ושאילתות. כל פרסונה כוללת רקע דמוגרפי, בריאותי ומקצועי, לצד סגנון שיחה. הרעיון המרכזי הוא שההעדפות נחשפות בעקיפין בתוך שיחות יומיומיות, כמו בקשה לעריכת אימייל שחושפת אלרגיה, מבלי שהמשתמש מצהיר עליהן ישירות.

כל התוכן סונתז באמצעות GPT-5 ועבר סינון איכות להסרת סתירות וכפילויות, תוך שימוש בתיאורי בסיס מתוך PersonaHub. החלוקה מתפצלת למסלול טקסטואלי ולמסלול מולטימודלי הכולל תמונות. כל מסלול מחולק לסטים נפרדים של אימון, ולידציה ובנצ'מרק, ללא חפיפה של מזהי פרסונות בין הסטים. לצד אלה יש קובצי JSON גולמיים של פרסונות, היסטוריות שיחה מלאות, וקובץ של שיחות לא רלוונטיות ממאגרי מתמטיקה וקוד כמו GSM8K שנועד לנפח את ההקשר.

מתאים ל

  • הערכת זיכרון סוכן ארוך טווח

    בדיקת יכולת המודל לשלוף פרטי משתמש שנרמזו בעבר מתוך הקשר של עד 128 אלף טוקנים.

  • אימון להתאמה אישית של תשובות

    כוונון מודלי שיחה על סטי האימון כדי שיתאימו את התשובה להעדפות המשתמש בלי תשאול ישיר.

  • בדיקת שמירה על פרטיות

    מדידה אם המודל נמנע מלחשוף מידע רגיש שהמשתמש שיתף בעבר וביקש שלא לזכור.

איפה זה נופל

כל הנתונים סינתטיים ונוצרו על ידי מודל שפה, ללא אימות ידני של כל דוגמה. היוצרים מזהירים מפני הטיות סטריאוטיפיות שעלולות להישאר בפנים. הנתונים זמינים באנגלית בלבד ואינם כוללים עברית. בנוסף, חלונות הקשר של 128k טוקנים ותמונות בקידוד base64 דורשים משאבי חישוב כבדים מאוד כדי להריץ אימון או הסקה.

אותה משפחה

PersonaMem יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון CC-BY-4.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים של חברה. החובה היחידה היא לתת קרדיט ברור ליוצרים ולציין קישור לרישיון.

האם יש בדאטהסט תמיכה בעברית?

לא. כל הפרסונות, הדיאלוגים והשאילתות נוצרו באנגלית בלבד. אם המוצר שלכם מיועד לעברית, תצטרכו לתרגם את הנתונים או לייצר סט מקומי מקביל.

מאיפה הגיעו הנתונים ומי אימת אותם?

התוכן נוצר במלואו באמצעות מודל GPT-5 על בסיס פרופילים מ־PersonaHub. החוקרים השתמשו במסנני איכות וסילוק סתירות אוטומטיים, אך הם מצהירים במפורש שלא בדקו ידנית כל רשומה.

איך בנוי מבנה ההקשר הארוך בבנצ'מרק?

לכל רשומה יש היסטוריית שיחה נפרדת של 32 אלף או 128 אלף טוקנים בפורמט JSON. כדי להעריך את המודל מחברים את השאילתה לסוף היסטוריית השיחה, שחלק ממנה מנופח בדיאלוגים לא קשורים של קוד ומתמטיקה.

איך טוענים

המאגר ציבורי ופתוח להורדה ישירה ללא צורך באישור גישה. הוא כולל מעל 9,000 קבצים, בעיקר קובצי CSV של הפיצולים וקובצי JSON עבור היסטוריות השיחה והפרסונות. כדי להריץ הערכה בהקשר ארוך, צריך לטעון את קובץ ה־CSV המתאים, לאתר את היסטוריית השיחה המשויכת מקובצי ה־JSON בגרסאות של 32k או 128k טוקנים, ולשרשר את שדה user_query לסוף ההיסטוריה. בגרסאות המולטימודליות התמונות שמורות ישירות כמחרוזות base64 בתוך ה־JSON.

from datasets import load_dataset

ds = load_dataset("bowen-upenn/PersonaMem-v2")

הרישיון

הרישיון הוא CC-BY-4.0. אפשר להשתמש בדאטהסט למטרות מחקר וגם לפרויקטים מסחריים, כולל אימון מודלים פנימיים או פיתוח מוצרים. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים לפי ההנחיות. אין חובה לשתף את המודל או את הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗