GPT
W

wikidata

קוד פתוח

philippesaadecc0-1.02025-01-23

  • wikidata
  • wikimedia

גרסה מעובדת של ויקינתונים שמכילה מעל 73 מיליון ישויות עם תוויות מובנות בתוך הקשרים. היא חוסכת את הצורך בהצלבות מורכבות כדי להבין מה כל מזהה אומר.

  • 11,839הורדות בחודש
  • 21לייקים

מה זה

המאגר מכיל 73,769,737 רשומות שמייצגות ישויות ומאפיינים מתוך ויקינתונים, לאחר סינון של מאמרים אקדמיים מתוך דאמפ מקורי שכלל 120,182,414 פריטים. כל רשומה כוללת מזהה ייחודי מסוג QID לישות או PID למאפיין, שמות, תיאורים וכינויים בכל השפות הזמינות במיזם. בנוסף נשמרים קישורים לדפים מקבילים בפרויקטים של ויקימדיה כמו ויקיפדיה, ויקימסע וויקיטקסט.

ההבדל המשמעותי בין המאגר הזה למקור הוא פתרון התוויות בתוך הטענות. במקום להשאיר רק מזהים גולמיים של תכונות וישויות, היוצרים הצמידו תוויות ישירות לטענות, כולל ערכים, מקורות, דירוגים ומאפיינים נוספים, כדי לאפשר קריאה רציפה של המידע בלי לבצע שאילתות הצלבה נפרדות לכל שדה.

מתאים ל

  • אימון מודלים לקישור ישויות

    מיפוי שמות וכינויים מתוך טקסטים חופשיים ישירות למזהי ישויות קבועים.

  • בניית גרפי ידע לחיפוש

    הזנת מנועי חיפוש ביחסים מובנים בין ישויות ללא צורך בהצלבת מזהים נפרדת.

  • העשרת פרופילים של ישויות

    שליפת תיאורים, קישורים לוויקיפדיה ומאפיינים עובדתיים על מושגים ואישים.

איפה זה נופל

במאגר הוסרו מאמרים אקדמיים, כך שהוא לא מתאים למי שמחפש מידע ביבליוגרפי או ניתוח של ספרות מדעית. בנוסף, אף שהמאגר תומך בכל שפות ויקינתונים, רמת הכיסוי של תיאורים, שמות וטענות בעברית תלויה בעריכות שנעשו במיזם עצמו, והיא לרוב נמוכה יותר מאשר באנגלית. יש לשים לב גם לתאריך הדאמפ המצוין בתיעוד, 7 במאי 2026, שהוא תאריך עתידי שנרשם בכרטיס המקור ואינו תואם תאריך אמת שחלף.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. הרישיון הוא CC0 1.0, שמוותר על כל זכויות היוצרים ומאפשר שימוש מסחרי מלא בלי לשלם ובלי לבקש אישור.

איך נאספו הנתונים ומה סונן מתוכם?

הנתונים נלקחו ישירות מוויקינתונים. מתוך כ־120 מיליון רשומות מקוריות, המפרסמים סיננו החוצה מאמרים אקדמיים ונשארו עם כ־73.7 מיליון ישויות ומאפיינים.

האם המאגר כולל תוכן בעברית?

כן, המאגר רב-לשוני ומכיל את כל השפות שקיימות בוויקינתונים. עם זאת, התוויות והתיאורים בעברית קיימים רק עבור ישויות שמשתמשי ויקינתונים תרגמו בפועל.

במה הוא שונה מהורדה ישירה של ויקינתונים?

בדאמפ הרגיל הטענות כוללות רק מזהים של ישויות ותכונות, מה שמחייב הצלבות כדי לקרוא את המידע. כאן היוצרים כבר הצמידו את התוויות הטקסטואליות לתוך הטענות עצמן.

איך טוענים

הנתונים מחולקים ל־7,451 קבצי parquet בתוך תיקיית data, והגישה אליהם פתוחה לחלוטין ללא צורך באישור מראש. בגלל כמות הקבצים וההיקף של עשרות מיליוני רשומות, כדאי לטעון אותם בחלקים או בהזרמה ולא להוריד את כל המאגר בבת אחת לזיכרון מקומי. השדות המרכזיים לעבודה כוללים את המזהים, התוויות בשפות השונות, והטענות המובנות שמכילות את עיקר הידע.

from datasets import load_dataset

ds = load_dataset("philippesaade/wikidata")

הרישיון

המאגר מופץ תחת רישיון CC0 1.0, שמשמעותו שחרור לרשות הציבור. אפשר להשתמש בו לכל מטרה, כולל שימוש מסחרי ואימון מודלים, ללא חובת ייחוס וללא דרישה לשתף את התוצרים באותו רישיון.

הרישיון המלא ב־Hugging Face ↗