GPT
L

lambada

קוד פתוח

cimeccc-by-4.02022-03-02

  • long-range-dependency

המאגר בודק יכולת של מודלים להבין הקשר רחב בטקסט סיפורי. הוא מיועד למי שרוצה לבחון ניבוי מילים שתלוי ברצף שלם ולא רק במשפט בודד.

  • 32,158הורדות בחודש
  • 67לייקים

מה זה

הנתונים מבוססים על קטעים שנלקחו מתוך ספרים בפרויקט BookCorpus. הרשומות מורכבות מפסקאות סיפוריות שבהן המילה האחרונה היא מילת היעד לניבוי. הסינון בוצע בעזרת נסיינים בתשלום, והוכנסו למבחן רק קטעים שבהם אדם הצליח לנחש את המילה האחרונה כשקרא את כל הפסקה, אבל אף אדם לא הצליח לנחש אותה כשרק המשפט האחרון הוצג לו.

החלוקה כוללת קבוצת אימון, קבוצת פיתוח וקבוצת בדיקה. קבוצת האימון מורכבת מרומנים שלמים ללא סינון מיוחד, ואינה חופפת לספרים שמהם נלקחו קטעי הפיתוח והבדיקה. בנוסף, לקטעים החשופים לתוכן פוגעני הופעל סינון ראשוני בעזרת רשימת מילים חסומות.

מתאים ל

  • הערכת מודלי שפה

    בדיקת יכולת המודל לזכור פרטים ולנחש מילה מתוך הבנת הקשר רחב ולא רק מילים סמוכות.

  • אימון על טקסט ספרותי

    אימון או המשך כוונון של מודלי שפה על טקסט סיפורי ארוך באנגלית מתוך רומנים.

  • מחקר תלויות ארוכות טווח

    השוואת ארכיטקטורות שונות סביב היכולת לתפוס הקשר מעבר לגבולות המשפט הבודד.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין כאן נתונים בעברית או בשפות אחרות. המקור מבוסס על ספרות מתוך BookCorpus, כך שהסגנון נרטיבי מאוד ולא מייצג שיחות יומיומיות, שפה טכנית או מסמכים מקצועיים. הכרטיס אינו מפרט מידע על הטיות חברתיות או פרטים מזהים מעבר לסינון מילים פוגעניות, ולכן בדיקת התאמה למוצר דורשת זהירות מפני תוכן ספרותי בעייתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון הוא cc-by-4.0 ומאפשר שימוש מסחרי. החובה המרכזית היא לתת ייחוס הולם ליוצרים המקוריים ולציין אם בוצעו שינויים בנתונים.

האם יש במאגר טקסטים בעברית?

לא. כל הנתונים נאספו באנגלית בלבד מתוך ספרים באנגלית, ללא שפות נוספות.

איך נבחרו הקטעים למבחן?

החוקרים נעזרו בנסיינים שבדקו את הטקסטים. קטע התקבל רק אם קריאת כל הפסקה אפשרה לנחש את המילה האחרונה במדויק, בעוד קריאת המשפט האחרון לבדו לא הספיקה לאף בודק.

באיזה פורמט הקבצים מגיעים ואיך טוענים אותם?

הנתונים זמינים בקובצי Parquet המחולקים לאימון, פיתוח ובדיקה. אפשר לטעון אותם בספריות סטנדרטיות ישירות מתוך המאגר ללא צורך בהרשאות מיוחדות.

איך טוענים

המאגר שמור בפורמט Parquet בחלוקה לקבצי רכבת, פיתוח ובדיקה, ללא צורך באישור גישה מיוחד. הרשומות כוללות שדה טקסט שמכיל את הרקע, משפט המטרה ומילת היעד בסופו. בחלק האימון קיים גם שדה קטגוריה שמציין את סוגת הספר, שדה שאינו מופיע בחלקי הבדיקה והפיתוח.

from datasets import load_dataset

ds = load_dataset("cimec/lambada")

הרישיון

הנתונים מופצים תחת רישיון cc-by-4.0. מותר להשתמש בהם לצרכים מסחריים ומחקריים, לשנות אותם ולהפיץ אותם הלאה, בתנאי שנותנים קרדיט מתאים ליוצרים ומציינים אם נעשו שינויים. אין דרישה לשתף תוצרי אימון או נגזרות באותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗