GPT
B

PolyAI/banking77

קוד פתוח

PolyAIcc-by-4.02022-04-27

יש כאן גם סקירה על Poly AI עצמו.

13,083 פניות שירות לקוחות מעולם הבנקאות המקוון, מתויגות בדיוק גבוה לפי 77 כוונות שונות. זה המאגר לבדיקת סיווג כוונות צפוף וממוקד תחום.

  • 13,196הורדות בחודש
  • 91לייקים

מה זה

המאגר מכיל שאילתות קצרות של לקוחות בנקאות, שכל אחת מהן מוצמדת לאחת מתוך 77 תוויות ספציפיות כמו אובדן כרטיס, עמלות העברה או בעיות אימות זהות. הדוגמאות קצרות, עם אורך ממוצע של כ־54 עד 60 תווים למשפט. הרשומות כוללות שני שדות בלבד: מחרוזת הטקסט ומזהה מספרי של התווית שנע בין 0 ל־76.

החלוקה הפנימית מוגדרת מראש ומפרידה 10,003 דוגמאות לאימון ו־3,080 דוגמאות לבדיקה. שני החלקים מכסים את כל 77 הכוונות. היוצרים לא מפרטים בכרטיס מהיכן בדיוק נלקחו הטקסטים המקוריים, מי כתב אותם ואיך בוצע הסינון הראשוני.

מתאים ל

  • אימון מסווג כוונות בנקאי

    בניית מודל לזיהוי 77 כוונות שונות של לקוחות בנקאות דיגיטלית באנגלית.

  • בנצ׳מרק למודלי שפה

    הערכת ביצועים של מודלים בהבחנה בין קטגוריות טקסט קרובות ודומות מאוד.

  • ניתוב פניות תמיכה

    פיתוח מנוע לניתוב אוטומטי של שאלות משתמשים למחלקות המתאימות בשירות.

איפה זה נופל

הנתונים כולם באנגלית בלבד. אם המוצר שלכם פונה לקהל ישראלי בעברית, המאגר לא יעזור בלי תרגום והתאמה מקומית. מעבר לזה, הכרטיס משאיר שדות ריקים בנוגע למידע רגיש, הטיות, זהות הכותבים ואופן איסוף הטקסט. הנתונים מתארכים לפחות לשנת 2020, כך שמושגים פיננסיים חדשים לא מופיעים שם.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא. אתם רק נדרשים לתת קרדיט ליוצרים שפרסמו אותו.

האם המאגר כולל נתונים בעברית?

לא, כל 13,083 הרשומות כתובות באנגלית בלבד. אין תמיכה מובנית בשפות אחרות.

מה היתרון שלו מול מאגרים כמו SNIPS או CLINC150?

מאגרים ישנים מכילים בדרך כלל פחות מ־10 כוונות או מתפזרים על תחומים שונים. המאגר הזה מתמקד רק בבנקאות ומציע רזולוציה דקה של 77 כוונות.

האם ידוע מאיפה הטקסטים נאספו?

לא, כרטיס המאגר משאיר את שדות מקור המידע ותהליך האיסוף ללא פירוט. מדובר בפניות לקוחות אונליין, אבל המקור המדויק לא צוין.

איך טוענים

טוענים אותו ישירות מספריית datasets של Hugging Face בלי צורך בהרשאות גישה מיוחדות או אישור מוקדם. המאגר כולל ארבעה קבצים בסיסיים, כולל סקריפט טעינה והגדרות, והמשקל הכולל של הטקסטים קטן מאוד. בזמן העבודה תצטרכו למפות את השדה המספרי label למחרוזת הכוונה המתאימה לו מתוך הטבלה בכרטיס.

from datasets import load_dataset

ds = load_dataset("PolyAI/banking77")

הרישיון

הרישיון הוא Creative Commons Attribution 4.0 International, כלומר cc-by-4.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולאמן עליו מודלים חופשי, בלי חובת שיתוף באותו רישיון. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים מ־PolyAI לפי דרישות הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗