GPT
J

jfleg

קוד פתוח

jhu-clspcc-by-nc-sa-4.02022-03-02

  • grammatical-error-correction

מאגר לתיקון שגיאות דקדוק ושיפור שטף באנגלית, עם ארבעה תיקונים אנושיים שונים לכל משפט מקור. הוא מיועד בעיקר לבדיקה והערכה של מודלים מול ניסוח טבעי ולא רק מול חוקי דקדוק יבשים.

  • 2,675הורדות בחודש
  • 77לייקים

מה זה

במאגר יש 1,511 משפטים באנגלית שנכתבו על ידי לומדי השפה, כשלכל משפט מצורפות ארבע גרסאות מתוקנות שנכתבו בידי אדם. המטרה כאן היא לא רק לתקן שגיאות כתיב או תחביר בסיסיות, אלא להביא את המשפט לרמת שטף שנשמעת טבעית לדוברי שפת אם. סדר התיקונים עקבי, כך שהתיקון הראשון ברשימה שייך תמיד לאותו מעריך, מה שמאפשר לנתח סגנונות עריכה שונים לאורך המאגר.

הנתונים מחולקים לשני חלקים בלבד, ללא סט אימון ייעודי. יש כאן 754 משפטים בסט הפיתוח ו־747 משפטים בסט הבדיקה. כרטיס המאגר לא מפרט את אופן איסוף הטקסטים המקוריים, זהות הכותבים או שיטת העבודה המדויקת של המעריכים, ומפנה למאמר המקורי לצורך פרטים אלה.

מתאים ל

  • הערכת מודלי תיקון טקסט

    בדיקת איכות של מודלים לתיקון שגיאות כתיב ודקדוק מול מספר אפשרויות ניסוח אנושיות.

  • מדידת שטף וטבעיות ניסוח

    השוואת ביצועים במשימות שדורשות שכתוב ברמה של שפת אם ולא רק תיקון טכני יבש.

  • בדיקת ביצועים ללומדי אנגלית

    בחינת יכולת המערכת להתמודד עם סגנון שגיאות אופייני לאנשים שאינם דוברי אנגלית מלידה.

איפה זה נופל

זה לא מאגר לאימון מודלים מאפס, אלא בעיקר בנצ׳מרק להערכה, עם פחות מ־1,600 דוגמאות ובלי סט אימון רשמי. הדאטהסט כולל אנגלית בלבד, ואין בו ייצוג לשפות אחרות או לטעויות אופייניות של ישראלים שלומדים אנגלית. בנוסף, הכרטיס לא מספק מידע על סינון פרטים מזהים או הטיות אפשריות בטקסטים, כך שאם אתם בונים שירות שחשוף לקהל רחב, כדאי לעבור ידנית על הדוגמאות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC-BY-NC-SA 4.0, שמגביל את השימוש למטרות לא מסחריות בלבד ומחייב שיתוף תחת אותם תנאים. אם אתם מתכננים להטמיע מודל במוצר שמייצר הכנסות, הדאטהסט הזה לא מתאים.

כמה המאגר שוקל וכמה זמן לוקח להוריד אותו?

הוא זעיר וכולל שני קובצי Parquet בלבד, אחד לפיתוח ואחד לבדיקה, לצד קובץ התיעוד. מדובר ב־1,511 רשומות בסך הכל, כך שההורדה לוקחת שניות בודדות ולא דורשת משאבי אחסון מיוחדים.

האם יש במאגר תמיכה בעברית?

אין במאגר עברית בכלל. כל הטקסטים נכתבו באנגלית על ידי לומדי שפה, והתיקונים נערכו באנגלית בלבד על ידי דוברי השפה.

מה ההבדל בין המאגר הזה למאגרי שגיאות דקדוק רגילים?

בניגוד למאגרים שמספקים תיקון מינימלי נקודתי, כאן הדגש הוא על שטף וטבעיות. בנוסף, לכל משפט יש ארבע הצעות תיקון שונות מארבעה אנשים, מה שמקל על מדידת ניסוחים חלופיים.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה של Hugging Face בלי צורך באישור גישה או מפתח מיוחד. הקבצים שמורים בפורמט Parquet קל וקומפקטי, כך שההורדה מסתיימת תוך שניות בודדות. המבנה כולל שני שדות עיקריים שצריך להכיר: sentence שמכיל את משפט המקור המשובש, ו־corrections שהוא מערך של ארבע מחרוזות עם ההצעות המתוקנות.

from datasets import load_dataset

ds = load_dataset("jhu-clsp/jfleg")

הרישיון

הרישיון הוא CC-BY-NC-SA 4.0, מה שאומר שאסור להשתמש בו לצרכים מסחריים. שימוש מחקרי דורש מתן קרדיט ליוצרים, וכל נגזרת של המאגר חייבת להישאר תחת אותו רישיון בדיוק. מודל שאומן על הנתונים האלה עלול להיות מוגבל לשימוש לא מסחרי בלבד.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗