GPT
M

multiblimp

קוד פתוח

jumeletcc-by-4.02025-04-03

המאגר כולל זוגות משפטים מינימליים לבדיקת ידע תחבירי במגוון עצום של שפות. הוא מיועד למי שרוצה להעריך את היכולת הדקדוקית של מודלי שפה בלי להסתמך רק על אנגלית.

  • 6,955הורדות בחודש
  • 17לייקים

מה זה

המאגר מכיל זוגות משפטים שנוצרו בצורה סינתטית לצורך הערכה לשונית מדויקת. בכל רשומה יש משפט תקין דקדוקית לצד מקבילו השגוי, כאשר המטרה היא לבדוק אם מודל שפה יודע להעדיף את המבנה הנכון על פני השיבוש התחבירי. הנתונים מבוססים על מידע דקדוקי ומורפולוגי שנלקח מתוך Universal Dependencies ופרויקט UniMorph, ושימש ליצירת הניגודים הלשוניים באופן אוטומטי ומבוקר.

החלוקה הפנימית בנויה לפי שפות, כאשר כל שפה מיוצגת בקובץ נפרד. הרשומות כוללות תכונות לשוניות רבות על כל זוג, כאשר השדות הבולטים והעיקריים הם המשפט התקין והמשפט השגוי. היקף הדוגמאות משתנה באופן חד בין שפה לשפה, והוא נע בין שפות שמכילות אלפי זוגות כמו רוסית או עברית, לבין שפות דלות משאבים שכוללות פחות מעשרים דוגמאות בודדות.

מתאים ל

  • מבחן תחבירי למודלים

    השוואת ההסתברות שמודל מקצה למשפט תקין מול משפט שגוי כדי למדוד דיוק לשוני.

  • השוואה רב-לשונית

    בדיקת פערים ביכולת הדקדוקית של מודל שפה בין שפות שונות באותו כלי הערכה.

  • בקרת איכות תרגום

    שימוש בזוגות המינימליים לבדיקת רגישות של מערכות לעיוותים מורפולוגיים נקודתיים.

איפה זה נופל

כל המשפטים נוצרו באופן סינתטי לחלוטין מתוך שילוב של כללים מורפולוגיים, ולא מדובר בטקסטים שנכתבו בידי דוברי שפה טבעיים. המשמעות היא שעלולות להופיע תבניות מלאכותיות או חזרתיות. בנוסף, חוסר האיזון בין השפות קיצוני, כאשר שפות מסוימות מחזיקות אלפי זוגות ואחרות מכילות שורות בודדות כמו גוג'ראטית עם שבע רשומות בלבד. הנתונים מתאימים לבדיקת מבנים דקדוקיים מוגדרים, אך אינם משקפים שימוש שפתי רחב או הבנה הקשרית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, רישיון המקור מאפשר שימוש מסחרי מלא כולל התאמה ושינוי של החומרים. החובה העיקרית היא מתן קרדיט ברור ליוצרים וקישור לרישיון המקורי. השימוש בדאטהסט להערכה או אימון אינו מחייב את שחרור המודל המסחרי שלך בקוד פתוח.

האם המאגר כולל עברית וכמה?

כן, יש במאגר ייצוג לעברית בשני קבצים שונים. הקובץ לעברית מודרנית מכיל 2,330 זוגות משפטים מינימליים. בנוסף, קיים קובץ נפרד לעברית עתיקה שכולל 983 זוגות נוספים.

איך נאספו המשפטים שבתוך הקבצים?

הנתונים לא נאספו מטקסטים חופשיים באינטרנט אלא יוצרו בצורה סינתטית ומבוקרת. היוצרים שילבו עצי גזירה ממאגר Universal Dependencies יחד עם מידע מורפולוגי מתוך UniMorph. תהליך זה ייצר אוטומטית זוגות משפטים שנבדלים זה מזה בתכונה דקדוקית יחידה.

במה המאגר שונה מגרסאות BLiMP המקוריות?

בעוד שמבחן BLiMP המקורי התמקד באנגלית בלבד, המאגר הזה מרחיב את השיטה לעשרות שפות שונות תחת אותו מבנה הערכה. ההבדל המרכזי הוא השימוש ביצירה סינתטית רב-לשונית מבוססת כללים, מה שמאפשר כיסוי רחב של שפות אך מוביל לפערי גודל משמעותיים בין שפה לשפה.

איך טוענים

הורדת הקבצים מתבצעת ישירות מול המאגר באמצעות הספרייה של Hugging Face, תוך ציון קוד השפה בפורמט ISO 639-3 כדי למשוך את קובץ הנתונים המתאים. כל שפה מגיעה כקובץ TSV יחיד ללא צורך בהרשאות גישה מיוחדות. בעת עיבוד הקובץ, השדות הקריטיים לריצה הם sen למשפט הנכון ו wrong_sen למשפט הפסול, אותם משווים מול המודל כדי לחשב את ההסתברות שהוא מעניק לכל אחד מהם.

from datasets import load_dataset

ds = load_dataset("jumelet/multiblimp")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי שניתן קרדיט מתאים ליוצרים המקוריים ומצוין אם נעשו שינויים. אין דרישה לשתף תוצרי המשך תחת אותו הרישיון, כך שאימון או הערכה של מודל אינם כובלים את המוצר עצמו להפצה חופשית.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗