GPT
C

clinc_oos

קוד פתוח

clinccc-by-3.02022-03-02

מאגר סיווג כוונות באנגלית שכולל 150 קטגוריות שונות ומחלקה ייעודית לשאילתות מחוץ לתחום. הוא מיועד למי שבונה סוכן שיחה ורוצה לבדוק אם המודל מזהה מתי לעצור במקום לנחש.

  • 16,670הורדות בחודש
  • 20לייקים

מה זה

כל רשומה במאגר מורכבת ממשפט טקסטואלי יחיד באנגלית ומתיוג מספרי שמייצג את הכוונה. סך הכל מוגדרות 150 כוונות שונות שמתפרסות על פני עשרה תחומים, לצד תיוג נפרד לשאילתות שנופלות מחוץ לטווח הכוונות הנתמכות.

הנתונים מחולקים לשלוש תצורות שונות לפי מטרת הניסוי: תצורת small שמכילה 50 דוגמאות אימון לכל כוונה מוגדרת, תצורת imbalanced שיוצרת חוסר איזון עם 25 עד 100 דוגמאות אימון לכל כוונה, ותצורת plus שמרחיבה את כמות דוגמאות האימון שמוגדרות מחוץ לתחום ל־250 במקום 100. בכל התצורות, קבוצת האימות כוללת 3,100 דוגמאות וקבוצת המבחן כוללת 5,500 דוגמאות.

הכרטיס מצטט מאמר מ־EMNLP 2019 מאת סטפן לארסון ושותפיו, אך לא מפרט כיצד הטקסטים נאספו בפועל, מי כתב אותם, איך התבצע הסינון או אם הוסר מידע אישי ורגיש.

מתאים ל

  • אימון מסווג לזיהוי חריגות

    אימון מודל שמזהה מתי משתמש שואל שאלה שלא נתמכת על ידי המערכת, בעזרת מחלקת out-of-scope.

  • בדיקת ביצועים בחוסר איזון

    הערכת עמידות של מסווג טקסט מול מחלקות עם מספר דוגמאות משתנה באמצעות תצורת imbalanced.

  • בנצ'מרק לסיווג מרובה מחלקות

    מדידת דיוק של מודלים בהפרדה בין 150 כוונות שונות בתחומי שירות וממשקי קול.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שהם לא יעזרו ישירות לאימון מודל בעברית. הכרטיס משאיר את רוב הסעיפים הטכניים ריקים ולא מפרט הטיות אפשריות, מידע רגיש או שיטות סינון. בנוסף, מדובר במשפטים בודדים מנותקים מהקשר ולא בדיאלוגים מלאים, מה שלא משקף שיחות מורכבות בעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון cc-by-3.0 מתיר שימוש מסחרי חופשי. החובה היחידה היא מתן קרדיט ברור ליוצרים וקישור לרישיון המקורי.

האם הדאטהסט מתאים למערכות בעברית?

לא באופן ישיר. כל הטקסטים במאגר נכתבו באנגלית, כך שתצטרכו לתרגם אותם או להשתמש בו רק לבדיקת ארכיטקטורות באנגלית.

באיזה גודל המאגר ומה היקף הרשומות שבו?

המאגר קטן וקל לתפעול מקומי, עם סדר גודל שנע בין 10,000 ל־100,000 רשומות בסך הכל. בתצורת plus הגדולה ביותר יש 15,250 דוגמאות אימון, 3,100 אימות ו־5,500 לבדיקה.

איך המאגר הזה שונה ממאגרי כוונות רגילים?

רוב המאגרים מניחים שכל שאילתה שייכת לאחת הקטגוריות הקיימות. כאן יש מחלקה מיוחדת של שאילתות לא רלוונטיות, מה שמאפשר לבחון אם המודל יודע להתמודד עם קלט לא צפוי.

איך טוענים

המאגר פתוח לגישה ישירה בהאגינג פייס ללא צורך באישור, ומאוחסן ב־11 קבצי Parquet לפי התצורות השונות. טוענים אותו באמצעות ציון שם התצורה המבוקשת, למשל plus או small. המבנה פשוט מאוד וכולל שני שדות בלבד: text שמכיל את המשפט, ו־label שמכיל את המזהה המספרי של הכוונה, כאשר תווית 42 מייצגת שאילתות מחוץ לתחום.

from datasets import load_dataset

ds = load_dataset("clinc/clinc_oos")

הרישיון

המאגר מופץ תחת רישיון cc-by-3.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי שאתם נותנים קרדיט מתאים ליוצרים ומציינים אם נעשו שינויים. אין דרישה לשתף תוצרי מודלים תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗