GPT
B

blended_skill_talk

קוד פתוח

ParlAIunknown2022-03-02

מאגר שיחות מובנה שנועד לאמן מודלים לשלב אמפתיה, ידע ואישיות באותו דיאלוג. הוא מתאים למי שרוצה לבדוק יכולת שיחה מורכבת במקום מענה רובוטי יבש.

  • 5,140הורדות בחודש
  • 75לייקים

מה זה

המאגר כולל כמעט שבעת אלפים שיחות באנגלית שנבנו במיוחד כדי לאמן סוכני שיחה לתמרן בין כמה מצבי תקשורת שונים. כל דוגמה כוללת הגדרת דמות, הקשר קודם של השיחה, והצעות תגובה ממספר מקורות מוכרים כמו מאגרי ידע, שיחות אמפתיות ודיאלוגים מבוססי אישיות. הרעיון הוא לתת לסוכן בחירה בין כמה סגנונות תגובה בכל שלב.

החלוקה הפנימית מורכבת משלושה חלקים סטנדרטיים. סט האימון מכיל 4,819 שיחות, סט הוולידציה כולל 1,009 רשומות, וסט המבחן מונה 980 שיחות נוספות. כל הרשומות מגיעות באותו מבנה נתונים שמשלב את היסטוריית השיחה יחד עם הצעות המענה והבחירות שבוצעו.

מתאים ל

  • אימון סוכני שיחה מרובי כישורים

    לימוד מודלים לשלב ידע כללי יחד עם ביטויים אישיים ואמפתיה.

  • הערכת יכולת דיאלוג משולב

    בדיקת היכולת של בוט לתמרן בין סגנונות שיחה שונים לפי הקשר.

  • מחקר על בחירת תגובות מונחית

    ניתוח מנגנוני דירוג ובחירה מתוך מספר הצעות מענה אפשריות.

איפה זה נופל

הנתונים קיימים אך ורק באנגלית, כך שהם לא יעזרו למי שמפתח מוצר שנועד לתקשר בעברית בלי תרגום או התאמה מקיפה. בנוסף, מדובר במאגר קטן יחסית של אלפי שיחות בודדות, שנאספו סביב שנת 2020, והכרטיס הרשמי שלו ריק לחלוטין מפרטים קריטיים על אופן הסינון, מקורות המידע המדויקים, או בדיקות רעילות והטיות חברתיות. לפני שמשלבים נתונים כאלה בסביבת עבודה אמיתית, חובה לדגום ידנית את התשובות ולוודא שהתוכן אינו פוגעני או מטעה.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

הרישיון בעמוד מוגדר כלא ידוע, ולכן אין אישור מפורש להשתמש בו במוצרים מסחריים. שימוש כזה עלול לחשוף אתכם לסיכונים משפטיים. מומלץ לבדוק את פרסומי המחקר המקוריים של הפרויקט כדי לברר את תנאי השימוש המדויקים.

האם יש במאגר שיחות בעברית?

המאגר כולל אך ורק נתונים בשפה האנגלית. אין בו שום ייצוג לעברית או לשפות אחרות. כדי להשתמש בו לסוכן ישראלי תצטרכו לתרגם את הנתונים באופן עצמאי.

כמה מקום ומשאבים צריך כדי להוריד את המאגר?

הקבצים קטנים מאוד וההורדה דורשת רק כ־38 מגה בייט של תעבורה. לאחר פריסה על הדיסק המאגר כולו תופס כ־53 מגה בייט. אפשר לעבוד איתו בקלות גם על מחשב נייד בסיסי ללא שרתים ייעודיים.

מה מייחד את השיחות האלו ממאגרי צ'אט אחרים?

במקום להתמקד במשימה יחידה כמו מענה על שאלות ידע, השיחות כאן תוכננו לשלב שלושה תחומים במקביל. כל דוגמה מנסה לחבר בין עובדות, אישיות מוגדרת ותגובות אמפתיות. המבנה מאפשר למודל ללמוד לא רק מה להגיד אלא גם באיזה טון להשתמש.

איך טוענים

טעינת המאגר מתבצעת ישירות דרך ספריית הנתונים של האגינג פייס ללא צורך בהרשמה מיוחדת או אישור גישה מראש. הקבצים שמורים בפורמט פרקט וגודל ההורדה הכולל עומד על 38.11 מגה בייט בלבד, כך שהם לא דורשים משאבי אחסון כבדים ותופסים כחמישים ושלושה מגה בייט על הדיסק.

בזמן העבודה חשוב לשים לב לשדות של ההצעות המונחות וההקשר, שמכילים את המיפוי בין סוגי התגובות השונים, כדי לוודא שאתם מזינים למודל את הפורמט הנכון למשימה שלכם.

from datasets import load_dataset

ds = load_dataset("ParlAI/blended_skill_talk")

הרישיון

הרישיון המדווח בעמוד הרשמי מוגדר כלא ידוע. המשמעות המעשית היא שאין כרגע היתר שימוש ברור, ולכן אסור להניח שמותר להשתמש במאגר לפרויקטים מסחריים או לאמן עליו מודל שמיועד למכירה. מפתחים שמעוניינים בשימוש מסחרי צריכים לאתר את תנאי ההפצה המקוריים של פרויקט המחקר לפני תחילת העבודה.

הרישיון המלא ב־Hugging Face ↗