GPT
D

dbpedia_14

קוד פתוח

fancyzhxcc-by-sa-3.02022-03-02

מאגר מוכן לסיווג טקסטים באנגלית לפי נושאים, עם חלוקה מאוזנת לגמרי וללא צורך בניקוי מקדים. מתאים בעיקר לבדיקת ביצועים מהירה של מודלים.

  • 17,994הורדות בחודש
  • 36לייקים

מה זה

המאגר כולל רשומות שנלקחו מתוך גרסת 2014 של מאגר הידע DBpedia, שמבוסס על ויקיפדיה. כל רשומה מורכבת מכותרת, פסקת תוכן ותווית סיווג אחת מתוך ארבע עשרה קטגוריות שונות שאינן חופפות. המבנה פשוט מאוד, הטקסטים אינם מכילים ירידות שורה, ומירכאות כפולות עברו החרגה כדי לשמור על תקינות הקריאה.

היוצרים דגמו באופן אקראי ארבעים אלף דוגמאות אימון וחמשת אלפים דוגמאות בדיקה עבור כל אחת מארבע עשרה הקטגוריות. החלוקה קבועה ומאוזנת לחלוטין, עם 560,000 רשומות בחלק האימון ו־70,000 רשומות בחלק הבדיקה, כך שאין צורך לבצע איזון ידני של המחלקות.

מתאים ל

  • השוואת מודלי סיווג

    בדיקת ביצועים תקנית ומהירה לאלגוריתמים בזכות חלוקה מאוזנת ומוגדרת מראש.

  • אימון מסווג נושאים

    לימוד מודלים לזהות נושא כללי של טקסט באנגלית לפי כותרת ותקציר.

  • ניסויי ייצוג טקסט

    בחינת שיטות שונות של אמבדינג וטוקניזציה על טקסט עובדתי קצר.

איפה זה נופל

הטקסטים מבוססים על מידע משנת 2014, כך שתוכן עדכני או אירועים מהעשור האחרון לא מופיעים כאן. השפה כמעט בלעדית היא אנגלית, מלבד שמות יצירות או ישויות בודדות שנשמרו בשפת המקור. מעבר לכך, הכרטיס לא מפרט הטיות, פרטיות, או מידע על תהליך התיוג, ולכן לא מומלץ להסתמך עליו במוצר חי בלי בדיקה של הייצוג התוכני.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא. המאגר מכיל טקסטים באנגלית בלבד, מלבד מילים בודדות או שמות זרים שהשתרבבו לכותרות מתוך ויקיפדיה. אם אתם מחפשים לאמן מודל בעברית, המאגר הזה לא מתאים.

האם מותר להשתמש בו ליישום מסחרי?

הרישיון מאפשר שימוש מסחרי, אך הוא כולל סעיף שיתוף זהה (ShareAlike). המשמעות היא שכל שינוי או הפצה של הנתונים מחייבים שחרור תחת אותו הרישיון, מה שיכול להגביל שימוש במוצרים סגורים.

איך נאספו הנתונים?

הנתונים נשלפו מתוך בסיס הידע של DBpedia בגרסת 2014, שמתבסס על תיבות המידע והטקסטים של ויקיפדיה. החוקרים בחרו 14 קטגוריות שונות ושלפו מתוכן דגימות אקראיות לכדי מבנה מאוזן של אימון ובדיקה.

האם הדאטהסט דורש אישור גישה מיוחד?

לא נדרש שום אישור. הקבצים פתוחים להורדה ישירה דרך Hugging Face כקבצי Parquet מוכנים לשימוש.

איך טוענים

המאגר מפורסם בפורמט Parquet בחלוקה פשוטה של שני קבצים, אחד לאימון ואחד לבדיקה, לצד קובץ התיעוד. הגישה חופשית ואין צורך בהרשאה מיוחדת כדי להוריד את הקבצים. בעת הטעינה מקבלים שלושה שדות בלבד: title, content ו־label. כדאי לזכור שבחלק מהמקרים שדה הכותרת יכול להיות ריק, ולכן מומלץ לחבר את הכותרת לגוף הטקסט לפני שמעבירים למודל.

from datasets import load_dataset

ds = load_dataset("fancyzhx/dbpedia_14")

הרישיון

הרישיון המדווח הוא cc-by-sa-3.0 בשילוב GFDL. מותר להשתמש במידע גם לפרויקטים מסחריים, אך יש חובת ייחוס ברורה ליוצרים. בנוסף, חל תנאי של שיתוף זהה, מה שאומר שאם אתם מפיצים נגזרת של הנתונים, תצטרכו לשחרר אותה תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗