GPT
C

conceptnet5

קוד פתוח

conceptnet5cc-by-4.02022-03-02

גרף ידע של קשרי היגיון בריא בין מילים בעשר שפות עיקריות. המאגר מציע קשרים סמנטיים מובנים לצד משפטי טקסט גולמיים לחילוץ ידע.

  • 4,755הורדות בחודש
  • 26לייקים

מה זה

המאגר כולל שלוש תצורות של נתונים: קשרי היגיון מובנים של גרף הידע, ושני קובצי טקסט של משפטי מקור מפרויקט Open Mind Common Sense. כל רשומה במבנה הראשי מציגה יחס בינארי, שני מושגים מקושרים, שפת המקור, ציון משקל לאמינות היחס, מידע נוסף בפורמט טקסט, ומשפט מקור אם קיים כזה.

התוכן נאסף משילוב של מיקור המונים, משחקים דיגיטליים ייעודיים, ומקורות מומחים כמו WordNet ומיזמי ויקימדיה. המאגר אינו מחולק מראש לסטים של אימון ובדיקה, והוא מכיל עשרות מיליוני קשרים מובנים אך כמות מוגבלת של משפטים גולמיים מלאים.

מתאים ל

  • אימון מודלי יחסים

    למידת חילוץ קשרים סמנטיים מתוך משפטי שפה טבעית גולמיים.

  • בניית גרפי ידע

    הרחבת מאגרי מושגים קיימים ביחסים מובנים בשפות הנתמכות.

  • הערכת היגיון בריא

    בדיקת יכולת של מודלים להבדיל בין קשרים הגיוניים לשגויים.

איפה זה נופל

הנתונים מבוססים על מיקור המונים שהתחיל עוד ב־1999, והיוצרים מציינים במפורש שהמשפטים אינם בהכרח נכונים, הולמים או שימושיים. הטיה תרבותית ואי דיוקים קיימים באופן מובנה בחלק הגולמי של המאגר. בנוסף, עברית אינה נכללת בעשר השפות הרשמיות, ויש פער עצום בין מיליוני הקשרים המופשטים לבין מספר המשפטים הטבעיים המלאים בפועל.

שאלות
נפוצות

האם המאגר כולל עברית?

המאגר מתמקד בעשר שפות עיקריות כמו אנגלית, צרפתית, גרמנית, ספרדית, רוסית, פורטוגזית, הולנדית, איטלקית, יפנית וסינית. עברית אינה מופיעה ברשימת השפות המוגדרות של המאגר. לא כדאי לבנות עליו לפרויקטים ייעודיים בשפה העברית.

האם מותר להשתמש בדאטהסט לפיתוח מסחרי?

מטא הדאטה בעמוד מציין רישיון CC-BY-4.0 שמתיר שימוש מסחרי בכפוף למתן ייחוס. עם זאת, כרטיס המאגר מציין כי נתוני המקור מופצים תחת CC-BY-SA 3.0 ומערבים מקורות כמו ויקיפדיה. שימוש במסד הנתונים עצמו במוצר מסחרי מחייב בדיקה משפטית של תנאי השיתוף זהה.

מאיפה הגיעו הנתונים של המאגר?

הנתונים נאספו לאורך שנים מפרויקט Open Mind Common Sense של MIT שפעל מ־1999, בשילוב משחקי רשת ומיזמי מילון פתוחים. הם כוללים קלטי משתמשים המוניים לצד בסיסי ידע מומחים כמו WordNet ו־JMDict. המשפטים הגולמיים לא עברו סינון קפדני ומשקפים את קלטי ההמונים כמו שהם.

איך מסננים קשרים לא אמינים מתוך המאגר?

בכל רשומת קשר יש שדה משקל שמכיל ערך בין אפס לאחד. ככל שהערך קרוב יותר לאחד, רמת הוודאות של הקשר גבוהה יותר לפי הגדרות המערכת. מומלץ לחתוך רשומות לפי סף משקל מסוים לפני הזנת הנתונים למודל.

איך טוענים

המאגר מאוחסן בפורמט Parquet המחולק ל־24 קבצים עיקריים, ללא צורך באישור גישה מיוחד. כדי לעבוד איתו צריך לטעון את אחת משלוש התצורות: התצורה המובנית של הקשרים, או אחת משתי תצורות המשפטים הגולמיים. השדות החשובים לסינון הם שפת הקשר, שדה היחס, ושדה המשקל שקובע את רמת הוודאות של הנתון.

from datasets import load_dataset

ds = load_dataset("conceptnet5/conceptnet5")

הרישיון

המאגר מוגדר ברישיון CC-BY-4.0 שמתיר שימוש מסחרי, שינוי והפצה כל עוד נותנים ייחוס הולם ליוצרים. עם זאת, התיעוד מציין כי נתוני המקור של הגרף נשענים על רישיון CC-BY-SA 3.0 ומקורות חיצוניים נוספים. מודל שמתאמן על הנתונים אינו מחויב אוטומטית ברישיון זהה, אך הטמעת הנתונים עצמם במוצר דורשת ייחוס מדויק ובדיקה של מגבלות הנגזרות.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗