GPT
T

trec

קוד פתוח

CogCompunknown2022-03-02

שאלות קצרות באנגלית עם תיוג היררכי כפול לסוג התשובה המבוקשת. כלי קלאסי לבדיקת מודלים על סיווג כוונות ללא משאבי מחשוב כבדים.

  • 11,718הורדות בחודש
  • 48לייקים

מה זה

מדובר במאגר קטן ומוכר לסיווג שאלות עובדתיות לפי סוג המידע שהן דורשות, למשל אדם, מקום או מספר. כל רשומה כוללת מחרוזת טקסט אחת של שאלה, ושתי תוויות סיווג שנבנו ידנית: רמה כללית עם 6 קטגוריות ראשיות, ורמה מפורטת שמפרקת אותן ל־50 תת-מחלקות שונות.

השאלות נאספו מארבעה מקורות נפרדים: 4,500 שאלות מפרסום של USC משנת 2001, כ־500 שאלות שנכתבו ידנית כדי לחזק מחלקות נדירות, ו־894 שאלות מתחרויות TREC 8 ו־TREC 9. סט המבחן מכיל 500 שאלות שמגיעות כולן מ־TREC 10. בטבלת החלוקה בפועל מופיעות 5,452 דוגמאות בסט האימון ו־500 בסט המבחן, כאשר אורך משפט ממוצע עומד על 10 מילים.

מתאים ל

  • סיווג שאלות עובדתיות

    אימון מודל שמזהה מראש האם שאילתה מחפשת שם של בן אדם, מיקום, תאריך או הגדרה מושגית.

  • בנצ'מרק מהיר למסווגים

    בדיקת ביצועים השוואתית בין ארכיטקטורות קלות משקל על משימת סיווג טקסט מרובת מחלקות.

  • למידה היררכית

    הערכת אלגוריתמים שיודעים לחזות במקביל קטגוריה ראשית רחבה ותת-קטגוריה מפורטת.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין כאן שום ייצוג לעברית או לשפות אחרות. מעבר לזה, מדובר בחומר ישן מאוד מתחילת שנות האלפיים, סביב 2001 ו־2002, כך שניסוח השאלות ותחומי העניין משקפים את האינטרנט של אותה תקופה ולא את האופן שבו אנשים מחפשים או מדברים היום. הכרטיס אינו מפרט מידע על הטיות, פרטיות או תהליך הסינון המדויק, ולכן לא הייתי מסתמך עליו לבדו לצורך מערכת ייצור מודרנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המדווח הוא unknown ואין בכרטיס שום היתר מפורש לשימוש מסחרי. במצב כזה מפתחים בחברות לוקחים על עצמם סיכון של הפרת זכויות יוצרים. בגלל חוסר הוודאות, עדיף להשתמש בו לניסויי מעבדה בלבד ולא להכניס מודל שאומן עליו לתוך מוצר.

האם יש במאגר תמיכה בשפה העברית?

לא, כל השאלות נאספו באנגלית בלבד. הכרטיס מציין en כשפה יחידה ואין בו תרגומים. מי שרוצה לעבוד בעברית יצטרך לתרגם את השאלות בעצמו או לחפש מקורות נתונים אחרים.

כמה שוקל הדאטהסט והאם נדרש שרת חזק לעיבוד שלו?

הקבצים להורדה שוקלים בסך הכל 0.36 מגה-בייט, ונפח הדיסק הכולל לאחר פריסה הוא פחות ממגה-בייט אחד. מדובר בכ־6,000 שאלות קצרות בסך הכל. אפשר לטעון ולאמן עליו אפילו על מחשב נייד בסיסי בלי שום צורך במאיץ גרפי חזק.

מאיפה הגיעו השאלות האלה ואיך תייגו אותן?

הנתונים נלקחו מארבעה מקורות שונים: 4,500 שאלות מפרסום של USC, כ־500 שאלות שנכתבו ידנית, ועוד כ־1,400 שאלות מתחרויות TREC ההיסטוריות. כל השאלות תויגו באופן ידני לשתי רמות של תוויות כדי ליצור את המאגר.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה של Hugging Face בלי צורך בהרשמה מיוחדת או אישור גישה. הנפח זעיר לחלוטין, סך הכל 0.36 מגה-בייט להורדה וכ־0.78 מגה-בייט על הדיסק, כך שהטעינה לזיכרון מתבצעת בשבריר שנייה.

המבנה פשוט ומכיל שלושה שדות בלבד: text עם מחרוזת השאלה, coarse_label בתור מספר שלם שמייצג את המחלקה הראשית, ו־fine_label שמייצג את המחלקה המדויקת. אין פה קובצי מדיה או הגדרות מורכבות, רק סקריפט פייתון שפורס את הדגימות ישר לתוך המודל.

from datasets import load_dataset

ds = load_dataset("CogComp/trec")

הרישיון

הרישיון מוגדר כ־unknown בכרטיס המאגר, ואין בו שום פירוט לגבי תנאי שימוש מסחריים, דרישות ייחוס או הגבלות על נגזרות. מצב כזה מייצר סיכון משפטי ברור לחברות שרוצות לאמן מודלים למוצר מסחרי. כל עוד המקור לא מצהיר רשמית על רישיון חופשי, עדיף להגביל את השימוש בו למחקר אקדמי, בדיקות פנימיות והשוואת ביצועים בלבד.

הרישיון המלא ב־Hugging Face ↗