GPT
P

personachat_truecased

קוד פתוח

bavardרישיון לא דווח2022-03-02

גרסה מתוקנת של מאגר שיחות מוכר, עם אותיות גדולות וריווח תקין במקום טקסט משובש. היא מתאימה למי שמאמן סוכני שיחה מבוססי אישיות ולא רוצה לנקות את הנתונים בעצמו.

  • 5,535הורדות בחודש
  • 45לייקים

מה זה

המאגר כולל שיחות באנגלית בין עובדי מיקור חוץ, שניהלו דיאלוג כשהם מתחזים לדמות עם מאפיינים מוגדרים מראש. המקור הוא PersonaChat של חוקרי פייסבוק מ־2018, בגרסה שהשתמשו בה בהאגינג פייס לקראת תחרות ConvAI2. המקור המקורי סבל מבעיה קשה: כל הטקסט נכתב באותיות קטנות בלבד והיו בו רווחים מוזרים לפני סימני פיסוק. היוצר של המאגר הנוכחי העביר את החומר דרך הצינור של Stanford NLP כדי לחלק למשפטים, לזהות שמות עצם פרטיים ולהחזיר אותיות גדולות לתחילת משפט, לשמות ולכינוי הגוף באנגלית.

כל רשומה במאגר מייצגת תור בודד בדיאלוג. המבנה שומר את מזהה השיחה, מיקום המשפט ברצף, רשימת משפטי האישיות שהוגדרו לדובר, והיסטוריית חילופי הדברים עד לאותו רגע. בנוסף, יש רשימת מועמדים לתגובה הבאה, שכוללת משפטים מטעים לצד התגובה האמיתית, שיושבת תמיד בסוף הרשימה. המאגר מציע קובצי אימון ואימות מלאים, לצד קובצי דוגמה מוקטנים.

מתאים ל

  • אימון סוכני שיחה מותאמים

    מודלים שלומדים לשמור על עקביות וסגנון קבוע לאורך דיאלוג לפי רשימת תכונות אישיות.

  • דירוג תגובות בחירה מרובה

    אימון מערכות לבחירת התשובה הנכונה מתוך רשימת מסיחים בעזרת פונקציית הפסד מתאימה.

  • הערכת עקביות בדיאלוג

    בדיקת יכולת המודל להיצמד לעובדות שהוגדרו מראש בהיסטוריית השיחה בלי להמציא סתירות.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין פה מילה אחת בעברית. השיחות נאספו מאנשים שהתחזו לדמויות לפי הנחיות קצרות, כך שהשפה מלאכותית לעיתים ולא משקפת שיחות שירות או תמיכה אמיתיות. בנוסף, החזרת האותיות הגדולות נעשתה בצורה אוטומטית לחלוטין בעזרת מודל שפתי, מה שאומר שיש שגיאות בניקוד שמות או זיהוי ישויות שלא תוקנו ידנית. מי שבונה מוצר צריך לקחת בחשבון שהבסיס נאסף ב־2018 ומיועד בעיקר לשיחות חולין קצרות.

שאלות
נפוצות

האם המאגר כולל שיחות בעברית?

לא. המאגר מורכב כולו משיחות באנגלית שנאספו מעובדי מיקור חוץ, ואין בו נתונים בשפות אחרות.

מה ההבדל בין המאגר הזה ל־PersonaChat המקורי?

הגרסה המקורית כללה אותיות קטנות בלבד וריווחים עודפים סביב סימני פיסוק. כאן הריווח נוקה והוחזרו אותיות גדולות לתחילת משפט ולשמות עצם פרטיים באמצעות כלי עיבוד שפה.

האם מותר להשתמש במאגר לפרויקט מסחרי?

אין במאגר הגדרת רישיון, מה שמשאיר את השימוש בו בתחום האפור ומסוכן משפטית למוצרים מסחריים. כדאי לבדוק את תנאי הרישיון של המאגר המקורי של פייסבוק מ־2018 לפני שמתחילים לאמן.

איך מוצאים את התשובה הנכונה מתוך רשימת המועמדים?

התשובה האמיתית שנתן הדובר נמצאת תמיד באיבר האחרון ברשימת ה־candidates. שאר המשפטים ברשימה הם מסיחים שמיועדים לאימון מודלים של בחירה מרובה.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטים באמצעות המזהה bavard/personachat_truecased או מקריאת קובצי ה־JSON המצורפים. המאגר ציבורי לחלוטין ואין צורך לבקש אישור גישה מראש. החומר מחולק לקובצי JSON מלאים של אימון ואימות, לצד גרסאות מדגם קטנות שנוחות לבדיקות ראשוניות. ברמת הקוד, השדות המרכזיים שמעניינים אתכם הם personality שמגדיר את הדמות, history שמחזיק את הקשר השיחה, ו־candidates שמציג את התשובות האפשריות כשהמשפט האחרון ברשימה הוא תמיד התשובה הנכונה של הדובר.

from datasets import load_dataset

ds = load_dataset("bavard/personachat_truecased")

הרישיון

היוצר לא ציין רישיון בעמוד המאגר. מבחינה משפטית, היעדר רישיון מפורש אומר שאין לכם היתר שימוש ברור, בוודאי שלא לפיתוח מסחרי של מודל או מוצר. המאגר מתבסס על מחקר של פייסבוק מ־2018 וגרסה של האגינג פייס, כך שלפני כל אימון למטרות שאינן מחקר עצמאי, תצטרכו לאתר את תנאי השימוש של הדאטהסט המקורי ולוודא שהם לא חוסמים אתכם.

הרישיון המלא ב־Hugging Face ↗