GPT
G

gutenberg_english

קוד פתוח

sedthhmit2023-02-28

  • project gutenberg
  • e-book
  • gutenberg.org

המאגר מרכז 48,284 ספרים באנגלית מפרויקט גוטנברג שעברו ניקוי מפסולת סריקה. זהו מקור ישיר לספרות חופשית עבור אימון מודלי שפה בלי תלות בתשלום על זכויות יוצרים.

  • 9,941הורדות בחודש
  • 38לייקים

מה זה

הנתונים כוללים מעל 80 אחוזים מכלל הספרים באנגלית שהיו זמינים בפרויקט גוטנברג בזמן האיסוף, כשהם מותאמים למבנה של פרויקט OpenAssistant. סורק ייעודי הוריד את דפי ה־HTML הגולמיים, וקוד נוסף ניסה להפריד בין גוף הספר לבין הערות מעתיקים והודעות מערכת של האתר. טקסטים שזוהו כפגומים או כאלו שסומנו במפורש תחת זכויות יוצרים הוחרגו מהאיסוף מראש.

המבנה מורכב משני חלקים עיקריים בכל רשומה, שניהם כמחרוזות טקסט. החלק הראשון הוא הטקסט הנקי של הספר, והשני הוא עמודת מטא-דאטה בתצורת JSON סדרתי. המטא-דאטה כוללת מזהה ייחודי של הספר, כותרת, תאריך הנפקה, מחברים, נושאים, סיווג מדפי ספרים וקוד LoCC.

מתאים ל

  • אימון מקדים למודלי שפה

    אימון מודלים על טקסט אנגלי ספרותי נקי וארוך ללא תשלום על רישיונות תוכן.

  • בדיקת חלונות הקשר ארוכים

    בחינת יכולת הזיכרון של מודלים מול ספרים שלמים שמגיעים כיחידת טקסט אחת.

  • ניתוח ספרותי וסיווג נושאים

    מיון טקסטים לפי מחברים, תקופות וסיווגי ספרייה שמופיעים במטא-דאטה המצורפת.

איפה זה נופל

הניקוי בוצע באמצעות סקריפט וביטויים רגולריים, מה שאומר שהפרדת הערות המעתיקים מגוף הספר אינה מושלמת. המאגר מכיל אנגלית בלבד, ורובו המוחלט מורכב מיצירות ישנות מאוד שפגו עליהן זכויות היוצרים בארצות הברית. השפה ארכאית, נושאי הכתיבה אינם מייצגים אנגלית מודרנית או עכשווית, ומלבד זאת ייתכן שספרים מסוימים עדיין מוגנים בזכויות יוצרים מחוץ לארצות הברית לפי החוק המקומי בישראל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

רישיון המאגר המדווח הוא MIT, שמתיר שימוש מסחרי מלא. יחד עם זאת, הטקסטים עצמם מגיעים מפרויקט גוטנברג וכוללים תנאי שימוש מקוריים, ולכן מומלץ לבדוק את עמודת המטא-דאטה ולוודא שהספרים אכן ברשות הציבור לפי הדין החל עליכם.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מוגדר ומכיל אך ורק ספרים בשפה האנגלית. למרות שבתיאור המקורי נכתב בטעות שהוא מכיל ספרים שאינם באנגלית, גוף הטקסטים והסיווגים בפועל הם של 48,284 ספרים באנגלית בלבד.

איך בוצע איסוף הנתונים והניקוי שלהם?

הספרים נאספו באמצעות סורק ייעודי מתוך קטלוג ה־HTML של פרויקט גוטנברג לפי מזהה הספר. מפענח טקסט ניסה להסיר הערות מנהלתיות, הקדמות וזכויות יוצרים, וספרים שסומנו מראש כמוגנים בזכויות יוצרים באנגלית הוחרגו.

באיזה מבנה מגיעים הנתונים בפועל?

המידע מופץ ב־38 קבצי parquet בפיצול יחיד של train. כל שורה מכילה מחרוזת של גוף הספר הנקי ומחרוזת JSON עם פרטים כמו כותרת, מחבר, תאריך ושיוך קטלוגי.

איך טוענים

טוענים את המאגר ישירות מחיבור לספריית datasets דרך המזהה sedthh/gutenberg_english ללא צורך בהרשאה מוקדמת או באישור גישה. החומר מחולק ל־38 קבצי parquet בפיצול train, ומכיל עמודת טקסט רגילה לצד עמודת JSON מקודדת למחרוזת. כדי לעבוד עם פרטי המחברים והנושאים, תצטרכו להריץ פענוח JSON על עמודת המטא-דאטה בזמן הטעינה.

from datasets import load_dataset

ds = load_dataset("sedthh/gutenberg_english")

הרישיון

המאגר מופץ תחת רישיון MIT שמתיר שימוש מסחרי, שינוי והפצה ללא דרישה לשיתוף תחת אותו רישיון. עם זאת, יוצרי המאגר מציינים כי פרויקט גוטנברג דורש הוספת הצהרה משפטית לגבי מעמד הספרים, וממליצים לוודא ידנית שהיצירות אינן מוגנות בזכויות יוצרים במדינת היעד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗