GPT
L

lambada_openai

קוד פתוח

EleutherAImit2022-12-16

מבחן שמודד יכולת ניבוי של המילה האחרונה בטקסט סיפורי על סמך הקשר רחב בלבד. הגרסה הזו כוללת את עיבוד הבדיקה של OpenAI ותרגומים אוטומטיים לארבע שפות אירופיות נוספות.

  • 113,391הורדות בחודש
  • 49לייקים

מה זה

המאגר כולל קטעי טקסט נרטיביים שנועדו לבחון הבנת הנקרא. המבנה בנוי כך שבני אדם מסוגלים לנחש את המילה האחרונה רק אם קראו את כל הפסקה, בעוד קריאת המשפט האחרון בלבד לא מספיקה לשם כך. המטרה היא לאלץ מודלים להחזיק מידע ממרחק ולא להסתמך על תבניות מקומיות סמוכות.

הבסיס מגיע מפיצול המבחן של LAMBADA בעיבוד המדויק ששימש את OpenAI במאמר של GPT-2. נוסף למקור האנגלי, הקבצים כוללים תרגום מכונה של אותו פיצול לגרמנית, ספרדית, צרפתית ואיטלקית שנוצר באמצעות גוגל תרגום. סך הכל יש במאגר בין אלף לעשרת אלפים רשומות המיועדות להערכה בלבד.

מתאים ל

  • בנצ'מרק להקשר רחב

    מדידת הדיוק של מודל שפה בניחוש המילה האחרונה בפסקה שלמה לעומת משפט בודד.

  • השוואה לפרסומי עבר

    שחזור והשוואת תוצאות ישירות מול נתוני המבחן שפורסמו במאמר המקורי של GPT-2.

  • בדיקת שפות אירופיות

    בחינת יכולת ההסקה של מודלים רב-לשוניים בגרמנית, צרפתית, ספרדית ואיטלקית מתורגמות.

איפה זה נופל

זהו סט להערכה בלבד ולא לאימון. ארבע מתוך חמש השפות הופקו באמצעות תרגום מכונה אוטומטי, מה שעלול לייצר ניסוחים עילגים או לפגוע במבנה התחבירי של הניסוי המקורי. בנוסף, אין כאן עברית כלל. אם המודל שלכם מיועד לשוק המקומי, תצטרכו לחפש מדדים אחרים. המאגר משקף שפה של טקסטים סיפוריים מלפני שנים, כך שהוא לא בודק שיחה, קוד או ידע מקצועי.

שאלות
נפוצות

האם המאגר כולל עברית?

לא, המאגר מוגבל לאנגלית ולתרגומים אוטומטיים לגרמנית, ספרדית, צרפתית ואיטלקית. אין בו טקסטים בעברית ולכן הוא לא מתאים להערכת מודלים המיועדים לשפה המקומית.

האם מותר להשתמש בו במוצר מסחרי?

הנתונים מפורסמים תחת רישיון MIT מותאם של OpenAI, שמאפשר שימוש חופשי כולל לצרכים מסחריים. כל מה שנדרש זה לשמור על הודעת הרישיון וזכויות היוצרים המקוריות בשימוש בקבצים.

איך נוצרו הגרסאות בשפות האחרות?

הפיצול האנגלי של OpenAI תורגם לגרמנית, ספרדית, צרפתית ואיטלקית באמצעות סקריפט שהפעיל את גוגל תרגום. לא נעשתה עריכה אנושית ידנית על התוצאות, ולכן ייתכנו אי דיוקים תרגומיים.

מה ההבדל בין זה לבין LAMBADA המקורי?

גרסה זו לוקחת את פיצול הבדיקה המעובד שפורסם סביב הפרויקט של GPT-2, במקום המקור הגולמי מ־2016. בנוסף, נוספו לה תרגומים מכונה שלא היו קיימים במחקר המקורי.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה של EleutherAI, ללא צורך בהרשמה מוקדמת או באישור גישה מיוחד. הקבצים זמינים בפורמט JSONL וגם בפורמט Parquet, כאשר כל שפה מופרדת לקובץ ייעודי משלה. מדובר במאגר קטן של כמה אלפי רשומות, כך שההורדה שוקלת מעט מאוד ומסתיימת תוך שניות בודדות. המבנה פשוט ומכיל טקסט רציף בכל שורה, כשהמטרה שלכם היא להזין את תחילת הקטע למודל ולבדוק התאמה מול המילה הסוגרת.

from datasets import load_dataset

ds = load_dataset("EleutherAI/lambada_openai")

הרישיון

הרישיון מוגדר כגרסה מותאמת של MIT, במקור ממאגר הקוד של GPT-2. רישיון כזה מתיר שימוש חופשי כולל שימוש מסחרי, כל עוד שומרים על הודעת זכויות היוצרים המקורית. אין כאן חובת שיתוף באותו רישיון עבור פיתוחים נגזרים. מכיוון שמדובר במבחן הערכה, שאלת אימון מודלים מסחריים פחות רלוונטית כאן, ומותר להריץ עליו בדיקות ביצועים פנימיות בחופשיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗