GPT
S

Synthetic-Persona-Chat

קוד פתוח

googlecc-by-4.02023-12-20

שיחות סינתטיות שנבנו סביב פרסונות מוגדרות כדי לאמן בוטים ששומרים על אופי עקבי. גוגל ייצרו אותו באמצעות מודלי שפה כדי לשפר את Persona-Chat המקורי.

  • 5,028הורדות בחודש
  • 138לייקים

מה זה

המאגר כולל שני חלקים עיקריים שמרכיבים יחד קצת יותר מעשרים ואחת אלף שיחות. החלק הראשון מרחיב את Persona-Chat המקורי ומכיל 4,723 פרסונות ו־10,906 שיחות סינתטיות חדשות, תוך שמירה על אותם זוגות פרופילים ועל חלוקת האימון, הוולידציה והבדיקה המקורית. החלק השני מציע סט חדש לגמרי שכולל 5,648 פרסונות סינתטיות ועוד 11,001 שיחות שנבנו עליהן.

כל רשומה בנויה משלושה שדות: רשימת מאפיינים עבור המשתמש הראשון, רשימת מאפיינים עבור המשתמש השני, ורצף השיחה ביניהם. הנתונים לא נאספו מבני אדם, אלא נוצרו באמצעות ארכיטקטורת Generator-Critic, שבה מודל שפה מייצר שיחות ותערובת מומחים של מודלי שפה מסננת ובוחרת את השיחות המוצלחות ביותר.

מתאים ל

  • אימון צ'אטבוט מבוסס אופי

    לימוד מודל שיחה להיצמד לפרופיל משתמש מוגדר מראש בלי לחרוג מהגבולות שהוגדרו לו.

  • הערכת עקביות של סוכנים

    בדיקת היכולת של מודלים קיימים לזהות פרסונה ולנהל שיחה שמתאימה לפרטי הדמות.

  • סימולציית שיחות בין משתמשים

    יצירת אינטראקציות סינתטיות מרובות משתתפים לצורך מחקר על דינמיקה בשיחה.

איפה זה נופל

הטקסט כולו באנגלית בלבד. הנתונים מיוצרים על ידי מודלים ולא משקפים דיבור אנושי אמיתי, על כל הסטיות והחזרתיות של מודלי שפה. התיעוד לא מפרט אילו מודלים שימשו כמחולל וכמבקרים, אין פירוט על סינון תוכן פוגעני או הטיות, ולא ברור עד כמה הפרסונות מייצגות מגוון מציאותי מעבר למה שהיה בזרע של Persona-Chat.

שאלות
נפוצות

האם הדאטהסט מתאים לעבודה בעברית?

לא. כל הנתונים במאגר נוצרו באנגלית בלבד. כדי להשתמש בו בעברית תצטרכו לתרגם את הפרסונות ואת השיחות, מה שעלול לפגוע באיכות הניסוחים הסינתטיים.

האם מותר להשתמש בנתונים כדי לאמן מוצר מסחרי?

כן, הרישיון הוא CC-BY-4.0 שמתיר שימוש מסחרי חופשי. התנאי היחיד הוא מתן ייחוס מתאים ליוצרים המקוריים של המאגר לפי הנחיות הרישיון.

מה ההבדל בינו לבין Persona-Chat הוותיק?

ב־Persona-Chat המקורי השיחות נאספו מאנשים, בעוד שכאן גוגל השתמשו במודלי שפה כדי לייצר שיחות חדשות ואיכותיות יותר על בסיס אותן פרסונות. בנוסף, המאגר כולל חלק שני עם אלפי פרסונות ושיחות סינתטיות חדשות לגמרי שלא היו במקור.

איך נוצרו השיחות בפועל?

החוקרים השתמשו בשיטה של Generator ו־Critic. מודל שפה אחד ייצר את השיחה לפי הפרופילים, ומערך של מודלי שפה ששימשו כמומחים העריך את התוצאות, סינן את השיחות החלשות ובחר רק את הטובות ביותר.

איך טוענים

המאגר פתוח לחלוטין ואינו דורש אישור גישה מיוחד. הנתונים יושבים בקובצי CSV פשוטים, כולל קובצי train, valid ו־test לחלק הראשון, וקובץ נפרד לחלק של הפרסונות החדשות. המבנה קל מאוד לקריאה, אבל צריך לשים לב שהשדות User 1 Persona, User 2 Persona ו־Conversation מאוחסנים כמבני נתונים של רשימות בתוך הטקסט, כך שתידרש פריסה שלהם לפני שמזינים אותם למודל.

from datasets import load_dataset

ds = load_dataset("google/Synthetic-Persona-Chat")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולהפיץ נגזרות שלו, כל עוד נותנים קרדיט מתאים ליוצרים מגוגל. הרישיון אינו כופה שיתוף באותו רישיון, כך שאפשר לאמן עליו מודלים מסחריים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗