GPT
S

squad_v2

קוד פתוח

rajpurkarcc-by-sa-4.02022-03-02

מאגר שאלות ותשובות מבוסס ויקיפדיה באנגלית, שכולל שאלות ללא מענה כדי לאמן מודלים לדעת מתי לשתוק ולא להמציא תשובות.

  • 92,072הורדות בחודש
  • 261לייקים

מה זה

הרשומות מבוססות על פסקאות מתוך ערכי ויקיפדיה, כשלכל פסקה מוצמדות שאלות שחוברו בידי עובדי מיקרו-משימות. התשובות הן קטעי טקסט מדויקים שמועתקים מתוך הפסקה המקורית, יחד עם מיקום התו המדויק שבו הן מתחילות.

הייחוד בגרסה הזו הוא שילוב של 100,000 השאלות מהגרסה הראשונה יחד עם יותר מ־50,000 שאלות שנכתבו בכוונה כדי להטעות. השאלות האלו נראות רלוונטיות לפסקה, אבל אין להן מענה בטקסט, ומודל נדרש לזהות שחסר מידע במקום לנחש.

המאגר מחולק לשני חלקים בלבד, אימון עם 130,319 דוגמאות ואימות עם 11,873 דוגמאות.

מתאים ל

  • אימון זיהוי חוסר מידע

    לימוד מודל לזהות מתי קטע טקסט אינו מכיל את המידע הנדרש, במקום לייצר הזיות.

  • חילוץ תשובות מתוך טקסט

    בניית מנוע למציאת קטעי טקסט מדויקים מתוך מסמכים ארוכים באנגלית.

  • הערכת ביצועי מודלים

    מבחן ביצועים סטנדרטי להשוואת יכולות הבנת הנקרא בין מודלים שונים.

איפה זה נופל

הטקסטים מוגבלים לשפה האנגלית בלבד ולסגנון הכתיבה האנציקלופדי של ויקיפדיה, כך שהם לא מתאימים למערכות שירות לקוחות, שיחה חופשית או עברית. בנוסף, כל התשובות הקיימות הן העתק-הדבק מתוך הפסקה, ללא הפשטה, סיכום או הסקת מסקנות מורכבת. הכרטיס גם לא מפרט אילו הטיות קיימות בנתונים או מתי בדיוק נאספו הערכים.

אותה משפחה

squad יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. כל הרשומות מבוססות על ויקיפדיה באנגלית בלבד. אם אתם צריכים לאמן מודל בעברית, המאגר הזה לא יעזור לכם בלי תרגום מלא.

מה ההבדל בין הגרסה הזו לגרסה הראשונה?

הגרסה הראשונה כללה רק שאלות שיש להן תשובה בטקסט, מה שגרם למודלים לנחש תמיד. כאן נוספו מעל 50,000 שאלות מטעות ללא מענה, כדי להכריח את המודל לדעת מתי אין תשובה.

האם מותר להשתמש בו במוצר מסחרי?

הרישיון מאפשר שימוש מסחרי כל עוד נותנים ייחוס. עם זאת, בגלל סעיף שיתוף זהה, שינויים במאגר עצמו חייבים להישאר פתוחים, וכדאי לבדוק ייעוץ משפטי לגבי מעמד המודל שמאומן עליו.

כמה מקום ומשאבים צריך כדי לעבוד איתו?

מדובר במאגר קל מאוד. קובצי ההורדה שוקלים כ־46.49 מגה-בייט, והנפח על הדיסק אחרי פריסה מגיע ל־175 מגה-בייט בלבד, כך שלא צריך שרת מיוחד כדי לטעון אותו.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בלי צורך באישור גישה מיוחד. הקבצים שמורים בפורמט parquet, שוקלים כ־46.49 מגה-בייט להורדה ותופסים סביב 175 מגה-בייט על הדיסק, כך שאפשר להריץ אותם על כל מחשב פיתוח בסיסי.

המבנה כולל שדות id, title, context, question ומילון answers. בשאלות ללא מענה, המילון של התשובות ריק, וצריך לוודא שהקוד שלכם מטפל במבנה הזה לפני שמתחילים באימון.

from datasets import load_dataset

ds = load_dataset("rajpurkar/squad_v2")

הרישיון

הרישיון הוא CC BY-SA 4.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, בתנאי שנותנים קרדיט מתאים. המלכוד העיקרי הוא סעיף השיתוף הזהה, שמחייב אתכם להפיץ כל יצירה נגזרת או שינוי של המאגר תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗