GPT
B

blimp

קוד פתוח

nyu-mllcc-by-4.02022-03-02

זוגות משפטים באנגלית לבדיקה מדויקת של ידע דקדוקי במודלי שפה. כל רשומה מעמתת משפט תקין מול משפט שגוי מינימלית.

  • 132,871הורדות בחודש
  • 39לייקים

מה זה

המאגר כולל זוגות מינימליים של משפטים שנועדו לבחון תופעות לשוניות מוגדרות היטב. כל דוגמה מורכבת ממשפט תקין מבחינה דקדוקית ומקבילו השגוי, כאשר ההבדל ביניהם מתמקד ברכיב תחבירי או סמנטי בודד. המבנה הזה מאפשר לבדוק אם מודל שפה מעניק סבירות גבוהה יותר למשפט הדקדוקי התקין, בלי להסתמך על שינויים באוצר מילים רחב.

המשפטים עצמם נוצרו באופן אוטומטי וממוחשב באמצעות תבניות מוגדרות, ולאחר מכן עברו סינון ותיקוף על ידי בני אדם דרך מיקור המונים. החלוקה הפנימית בנויה לפי קטגוריות בלשניות ספציפיות, ובכל תצורה כזו נכללות בדיוק 1,000 דוגמאות אימון ובדיקה. בין התחומים הנבדקים תמצאו התאם בין נושא לפועל, כינויי גוף, שלילה ורכישת שמות עצם.

הרשומות מכילות מידע מפורט על כל תופעה, כולל מונחים מקצועיים מעולם הבלשנות ודגלים בוליאניים שמציינים את השיטה המתאימה להשוואת הסבירויות במודל שפה. כל תת קבוצה מתמקדת בבידוד תופעה אחת בלבד, מה שמונע רעש סטטיסטי שמקורו בתוכן סמנטי אקראי.

מתאים ל

  • הערכת מודלי שפה

    בדיקת יכולת המודל להבחין בין משפט תקין למשפט שגוי דקדוקית.

  • ניתוח טעויות תחביריות

    איתור כשלים מבניים נקודתיים בהתאם של יחיד ורבים או שלילה.

  • מדד השוואתי לתחביר

    השוואת ביצועים בלשניים נקיים בין גרסאות שונות של מודלים.

איפה זה נופל

הנתונים כולם באנגלית בלבד ונוצרו באופן מלאכותי לחלוטין. המשפטים אינם משקפים שפה טבעית משיחות או מטקסטים אמיתיים, אלא תבניות בלשניות סטריליות שבודקות חוקים יבשים. בנוסף, המאגר פורסם בשנת 2022 ואינו מתאים לאימון מודל לשיחה או לכתיבה שוטפת, אלא רק למדידת ביצועים דקדוקיים מבוקרת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, הרישיון הוא cc-by-4.0 ומאפשר פעילות מסחרית מלאה. אתם נדרשים רק לתת ייחוס הולם ליוצרים המקוריים שפרסמו אותו. אין דרישה לפתוח את הקוד שלכם.

האם הדאטהסט תומך בעברית?

לא, המאגר נבנה כולו באנגלית בלבד. התבניות הלשוניות והחוקים הדקדוקיים הותאמו למבנה המשפט האנגלי. אין בו נתונים רלוונטיים לשפות אחרות.

כמה מקום המאגר תופס בדיסק?

המאגר קל מאוד ושוקל מגה בייטים בודדים בלבד. הוא מחולק לקבצי parquet קטנים שנפרסים מהר. ההורדה והטעינה שלו לוקחות שניות ספורות.

מאיפה הגיעו המשפטים שבמאגר?

הטקסטים נוצרו על ידי מחולל אוטומטי ממוחשב המבוסס על תבניות דקדוקיות. לאחר היצירה, כל הדוגמאות אומתו על ידי בני אדם באמצעות מיקור המונים. אין כאן טקסטים שנאספו מהרשת הפתוחה.

איך טוענים

טעינת הנתונים נעשית ישירות דרך ספריית הדאטהסטים הפופולרית, ללא צורך בהרשמה מוקדמת, בקשת אישור או מפתחות גישה. הקבצים שמורים בפורמט parquet קל משקל ומחולקים לפי קונפיגורציות שונות. השדות המרכזיים שמעניינים אתכם הם sentence_good ו sentence_bad, לצד שדות בוליאניים שמגדירים כיצד לחשב את סבירות הקידומת במודל.

from datasets import load_dataset

ds = load_dataset("nyu-mll/blimp")

הרישיון

הרישיון הוא cc-by-4.0 ומאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי של הנתונים והפצה מחודשת. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים מאוניברסיטת ניו יורק. אין חובה לשתף נגזרות באותו רישיון, ומודלים שמוערכים או מאומנים עליו אינם כבולים למגבלות נוספות.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗