GPT
M

mqa

קוד פתוח

clipscc0-1.02022-03-02

מאגר ענק של כ־234 מיליון צמדי שאלות ותשובות שנקצרו ישירות מהאינטרנט ב־39 שפות. הוא מתאים למי שבונה מודלי שאילתות וזקוק לכמויות מידע חריגות, כולל מיליון וחצי רשומות בעברית.

  • 1,304הורדות בחודש
  • 57לייקים

מה זה

הרשומות במאגר מייצגות שאלות ותשובות שחולצו מתוך קובצי WARC גולמיים של Common Crawl. המידע מחולק לשני סוגים עיקריים. הראשון הוא שאילתות קהילה, שבהן יש לרוב כותרת וגוף טקסט, ובדרך כלל מופיעות בהן כמה תשובות אפשריות עם סימון לתשובה שנבחרה כנכונה. הסוג השני הוא רשימות שאלות נפוצות מאתרי אינטרנט, שבהן מופיעה בדרך כלל תשובה יחידה לכל שאלה. המבנה כולל שדות של כותרת השאלה, גוף השאלה, ומערך תשובות שמכיל טקסט ומזהה האם התשובה התקבלה.

המאגר מאפשר טעינה בשלוש רמות ארגון שונות. ברירת המחדל היא ברמת השאלה הבודדת, אך ניתן לטעון את הנתונים מקובצים לפי דף אינטרנט מקורי, או לפי דומיין שלם. קיבוץ לפי דומיין נועד לסייע בהתמודדות עם כפילויות של שאלות נפוצות שמופיעות שוב ושוב באותו אתר. סך הכל כולל המאגר 317 קבצים דחוסים, כאשר רוב הנפח נשען על קובצי שאלות נפוצות באנגלית, אך קיימת נוכחות של עשרות שפות נוספות.

מתאים ל

  • אימון מודלי מענה לשאלות

    אימון מקדים של מודלי שפה על מאות מיליוני צמדי שאלות ותשובות שנאספו מדפי אינטרנט.

  • פיתוח מנועי חיפוש FAQ

    בניית מאגר להערכה וללימוד של מערכות לשליפת תשובות מתוך עמודי עזרה ושאלות נפוצות.

  • דירוג תשובות בפורומים

    אימון מודל לבחירת התשובה הנכונה מתוך רשימת תשובות אפשריות לפי נתוני קהילה שסומנו כהצלחה.

איפה זה נופל

מכיוון שהתוכן מגיע מקציר עיוור של האינטרנט, הוא סובל מכל הבעיות הקלאסיות של Common Crawl. יש כפילויות רבות, במיוחד במדורי שאלות נפוצות שמועתקים בין אתרים. הכרטיס אינו מפרט תהליכי סינון של תוכן רעיל, ספאם, מידע אישי או טקסט שבור. בנוסף, חלוקת השפות מוטה בצורה קיצונית לאנגלית, שמחזיקה מעל 188 מיליון צמדים, בעוד שפות אחרות מקבלות נפח קטן בהרבה. עברית למשל כוללת כ־1.5 מיליון צמדים, רובם המוחלט שאלות נפוצות ורק כ־88 אלף שאלות קהילה. חובה לבצע ניקוי והסרת כפילויות עצמאית לפני כל שימוש באימון.

שאלות
נפוצות

האם יש במאגר נתונים בעברית וכמה?

כן, המאגר מכיל עברית תחת התיוג he. יש בו 1,422,449 צמדי שאלות נפוצות ועוד 88,435 שאלות מתוך פלטפורמות קהילתיות. זהו נפח משמעותי לעברית בהשוואה למאגרים דומים.

האם מותר להשתמש במאגר לפרויקט מסחרי?

האריזה עצמה מוגדרת תחת CC0, כך שהיוצרים לא מטילים מגבלה מסחרית. עם זאת, הטקסטים נאספו ישירות מאתרים ברשת ללא הסכמת בעלי האתרים, והחוקרים מבהירים שאינם מחזיקים בזכויות על התוכן. שימוש מסחרי דורש מכם לקחת בחשבון את הסיכון המשפטי של קצירת תוכן מוגן.

מה ההבדל בין FAQ לבין CQA במאגר?

רשומות מסוג FAQ מגיעות מדפי שאלות נפוצות ומכילות לרוב כותרת ותשובה בודדת. רשומות CQA מגיעות מקהילות דיון, כוללות גוף שאלה מורכב ויכולות לכלול מספר תשובות שונות, כולל סימון של התשובה שהמשתמשים הגדירו כמקובלת.

איך מתמודדים עם כפילויות הטקסט?

המאגר מאפשר טעינה לפי רמת דומיין באמצעות הפרמטר level='domain'. הגדרה זו מחזירה שאלות מקובצות לפי אתר המקור, מה שמאפשר לדגום עמוד בודד מכל דומיין בכל תקופת אימון ולצמצם את החזרתיות.

איך טוענים

טוענים את המידע דרך ספריית datasets באמצעות load_dataset ומזהה המאגר clips/mqa. אין צורך באישור גישה מיוחד או בהרשמה מראש. חובה להגדיר את השפה הרצויה באמצעות הפרמטר language, למשל he לעברית או en לאנגלית, אחרת הטעינה לא תפעל כראוי. ניתן גם לסנן מראש בין שאלות נפוצות לתוכן קהילתי באמצעות הפרמטר scope, ולקבוע את רמת הקיבוץ בעזרת פרמטר level. השדות המרכזיים שצריך לעבד בפועל הם name, text ומערך ה־answers. המידע שמור בפורמט מרקדאון בתוך קובצי json.gz דחוסים.

from datasets import load_dataset

ds = load_dataset("clips/mqa")

הרישיון

האריזה וההפצה של המאגר שוחררו תחת רישיון CC0, כלומר נחלת הכלל ללא דרישת ייחוס או מגבלות שיתוף. יחד עם זאת, היוצרים מציינים במפורש שהם אינם בעלי זכויות היוצרים על הטקסטים עצמם שנאספו מהרשת, והם מתחייבים להסיר מקורות במקרה של תלונות על הפרת זכויות. אימון מודל מסחרי עלול לחשוף אתכם לסיכוני זכויות יוצרים שנובעים מתוכן המקור ברשת.

הרישיון המלא ב־Hugging Face ↗