GPT
C

common_gen

קוד פתוח

allenaimit2022-03-02

  • concepts-to-text

המאגר מרכז קבוצות מושגים ומשפטים שמשלבים אותם בהיגיון יומיומי. הוא בודק יכולת של מודלים לחבר מילים מוכרות לתיאור סביר של פעולות בעולם האמיתי.

  • 4,943הורדות בחודש
  • 30לייקים

מה זה

כל רשומה במאגר מורכבת מרשימת מושגים באנגלית, מזהה מספרי למערך המושגים, ומשפט מטרה אחד שמשלב אותם באופן הגיוני. המטרה היא להרכיב תרחיש קוהרנטי מתוך מילים כמו סקי, הר וגולש, בלי ליצור עובדות מוזרות או חיבורים לא טבעיים.

התוכן נאסף משילוב של מאגרי כתוביות קיימים ותיוג שבוצע באמצעות עובדים באמזון Mechanical Turk. בסך הכל המאגר מקיף כ־30 אלף סטים שונים של מושגים וכ־50 אלף משפטים שמתארים מצבים יומיומיים.

הנתונים מחולקים מראש לשלושה חלקים מוכנים. קובץ האימון כולל 67,389 דוגמאות, קובץ האימות מכיל 4,018 דוגמאות, וקובץ המבחן כולל 1,497 דוגמאות שנועדו לבחון הכללה על שילובי מילים שלא נראו קודם לכן.

מתאים ל

  • בדיקת היגיון במודלי שפה

    בחינה עד כמה המודל מסוגל לייצר תיאור הגיוני ומציאותי מתוך רשימת מילים נתונה בלי להמציא עובדות משונות.

  • אימון מודלי יצירת טקסט

    כוונון עדין של מודלי שפה למשימת ייצור טקסט תחת אילוצים של מילות מפתח מוגדרות מראש.

  • מבחן הכללה על מושגים

    הערכת היכולת של רשתות למידה להתמודד עם שילובים חדשים לחלוטין של מושגים מוכרים בסט המבחן.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין כאן שום תוכן בעברית. אם תרצו להשתמש בזה למודל מקומי, תצטרכו לתרגם את המושגים והמטרות בעצמכם, תהליך שעלול לאבד את הקשר ההיגיון הבריא שנבדק במקור. בנוסף, כרטיס הדאטהסט לא מפרט אילו הטיות קיימות בטקסטים או כיצד סונן מידע אישי ורגיש, כך שחובה לסרוק את התוכן ידנית לפני שמשלבים תוצרים כאלה באפליקציה אמיתית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון שמצורף למאגר הוא רישיון MIT. הוא מתיר לעשות שימוש מסחרי מלא בנתונים ולאמן עליהם מודלים לכל מטרה. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית במסגרת הפרויקט שלכם.

כמה שטח אחסון צריך כדי לעבוד איתו?

הורדת הקבצים שוקלת 1.85 מגה בייט בלבד. אחרי פריסה של הקבצים בפורמט Parquet, הגודל הכולל בדיסק מגיע ל־9.06 מגה בייט. מדובר במאגר קל מאוד שאפשר לטעון בשניות ישירות לזיכרון של מחשב רגיל.

האם יש במאגר דוגמאות בעברית?

לא, המאגר כולל אך ורק נתונים בשפה האנגלית. כדי לאמן מודלים בעברית על המשימה הזו, תידרשו לתרגם את רשימות המושגים ואת משפטי המטרה. פעולה כזו תדרוש בדיקה של תקינות התרגום וההיגיון הלשוני שנוצר.

איך נאסף המידע שבתוך המאגר?

איסוף הנתונים נשען על שילוב של מאגרי כתוביות תמונות קיימים יחד עם עבודת תיוג ידנית. עובדים מפלטפורמת אמזון Mechanical Turk כתבו משפטים שמחברים את קבוצות המושגים. החלוקה הסופית הוגדרה כדי לבדוק הכללה של חיבורי מילים חדשים.

איך טוענים

אין צורך ברישום מוקדם או אישור גישה כדי להוריד את הקבצים. המאגר מגיע כקבצי Parquet קלים מאוד, כשרק 1.85 מגה בייט יורדים מהרשת ונפרסים לכ־7.21 מגה בייט בזיכרון, כך שסך כל האחסון הנדרש עומד על 9.06 מגה בייט בלבד.

המבנה הפנימי שטוח וישיר לגמרי. השדות החשובים לעבודה הם רשימת המילים בתוך concepts ומחרוזת הטקסט המלאה בתוך target, כך שאתם מחברים אותם ישירות לכל ארכיטקטורת אימון מסוג טקסט לטקסט בלי סיבוכי עיבוד מוקדם.

from datasets import load_dataset

ds = load_dataset("allenai/common_gen")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מאפשר שימוש חופשי כולל שימוש מסחרי מלא, שינוי הנתונים ושילובם בכל מערכת, כל עוד שומרים על הודעת זכויות היוצרים המקורית. אין כאן שום דרישה לשתף את הקוד שלכם באותו רישיון, ומותר לאמן עליו מודלים מסחריים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗