GPT
Y

yahoo_answers_topics

קוד פתוח

community-datasetsunknown2022-03-02

מיליוני שאלות ותשובות באנגלית ממוינות לפי נושאים, הישר מארכיון הרשת הישן. אם אתם מחפשים בנצ'מרק קלאסי לסיווג טקסטים של שאלות משתמשים, זה המקור שמשמש לזה.

  • 7,956הורדות בחודש
  • 63לייקים

מה זה

המאגר כולל בין מיליון לעשרה מיליון רשומות המיועדות למשימות סיווג טקסט באנגלית. המידע נשען על שאלות ותשובות מאתר יאהו, כשהמטרה היא לחזות את הנושא של כל פוסט. כרטיס הדאטהסט המקורי ריק כמעט לחלוטין מפרטים טכניים ולא מתעד את תהליך הסינון, הניקוי או הגדרת השדות המדויקים, אך הוא מפנה למאגר גיטהאב של המשתמש LC-John שמרכז את הפרויקט.

מבחינת מבנה הקבצים, הנתונים מחולקים מראש לחלקי אימון ומבחן. חלק האימון מפוצל לשני קובצי Parquet, וחלק הבחינה מגיע בקובץ Parquet בודד. מעבר לעובדה שמדובר בתוכן שנוצר על ידי גולשים, אין בכרטיס תיעוד לגבי האופן שבו חולקו הנתונים בין הפיצולים השונים.

מתאים ל

  • סיווג שאלות לפי נושא

    אימון מודלים לזיהוי קטגוריה של שאילתות משתמשים באנגלית על בסיס מיליוני דוגמאות.

  • השוואת ביצועי מודלים

    הרצת בדיקות השוואה מול תוצאות עבר של סיווג טקסטים במאגרים קלאסיים.

  • מחקר על שפת רשת

    ניתוח ניסוחי שאלות של גולשים מאתרי שו"ת היסטוריים.

איפה זה נופל

כרטיס הנתונים לא מספק שום מידע על הטיות, פרטיות, או אופן סינון התוכן, ומשאיר כמעט כל סעיף תחת תבנית חסרה. מדובר בטקסטים באנגלית בלבד, שנאספו מפלטפורמת פורומים ציבורית ישנה ועלולים להכיל שפה בוטה, עובדות שגויות ומידע אישי של משתמשים שלא נוקה. אי אפשר לדעת מהכרטיס אילו נושאים קיימים ואיך תויגו, כך שחובה לדגום את השורות ידנית לפני שמכניסים אותו לתהליך עבודה רציני.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון המדווח הוא unknown, ולכן אין היתר שימוש מסחרי מוגדר. במצב כזה חברות מסחריות לוקחות סיכון משפטי, ועדיף לא להסתמך עליו בייצור ללא בירור מול בעלי הזכויות.

האם יש במאגר שאלות בעברית?

לא. הדאטהסט מוגדר לשפה האנגלית בלבד. כל הטקסטים שנאספו הגיעו מהגרסה האנגלית של הפלטפורמה.

איך הנתונים נאספו וסוננו?

דף המאגר לא מספק שום תיעוד על אופן האיסוף או הסינון. הקישור היחיד שמופיע מוביל למאגר גיטהאב חיצוני, אך אין פירוט על הסרת רעשים, כפילויות או מידע אישי.

כמה רשומות יש בדאטהסט?

היקף הדאטהסט נע בין מיליון לעשרה מיליון רשומות בסך הכל. הן מחולקות לשני קובצי אימון וקובץ בחינה אחד בפורמט Parquet.

איך טוענים

הטעינה נעשית ישירות דרך מזהה המאגר בספריית datasets הרגילה, ללא צורך בבקשת גישה מיוחדת או באישור ידני. הקבצים נשמרים בפורמט Parquet בחלוקה מוכנה של אימון ובדיקה. מכיוון שמדובר בכמה מיליוני רשומות, כדאי לקחת בחשבון את נפח הזיכרון הנדרש לעיבוד הראשוני לפני שמתחילים לאמן.

from datasets import load_dataset

ds = load_dataset("community-datasets/yahoo_answers_topics")

הרישיון

הרישיון מוגדר כלא ידוע. המשמעות היא שאין שום אישור רשמי לשימוש מסחרי, ואי אפשר לדעת מה המגבלות המשפטיות על מודל שתאמנו על בסיסו. אם אתם בונים מוצר מסחרי, מדובר בסיכון משפטי ומוטב להימנע משימוש בו.

הרישיון המלא ב־Hugging Face ↗