GPT
P

project_gutenberg

קוד פתוח

manuרישיון לא דווח2023-09-07

ספרים שלמים מהמאגר ההיסטורי של פרויקט גוטנברג בפורמט מודרני. מתאים למי שצריך טקסטים ארוכים וספרותיים לאימון מודלי שפה בכמה שפות אירופיות וסינית.

  • 10,004הורדות בחודש
  • 74לייקים

מה זה

המאגר כולל עשרות אלפי רשומות שמקורן בספרייה הדיגיטלית של פרויקט גוטנברג, המכילה מעל 70,000 ספרים אלקטרוניים חינמיים. כל רשומה מייצגת ספר שלם, כשהטקסט כולל פתיח וסיום של כמה שורות שתוחמים את תחילת וסוף הספר באמצעות תגיות ייעודיות.

התוכן נאסף ישירות מאתר הפרויקט ומאורגן בקובצי פארקט לפי שפות. יש כאן חלוקה ברורה לכמה שפות מרכזיות כמו אנגלית, צרפתית, גרמנית, ספרדית, איטלקית וסינית, בלי סינון מיוחד של התוכן הספרותי מעבר למבנה הבסיסי שכולל את תגיות הפתיחה והסגירה של המקור.

הכרטיס לא מפרט תהליכי ניקוי מורכבים שעברו הטקסטים. הספרים נשמרים כיחידות טקסט מלאות, מה שדורש מכם לחתוך או לעבד אותם לפי אורך ההקשר שהמודל שלכם מסוגל לעכל.

מתאים ל

  • אימון מקדים למודלי שפה

    לימוד מבנה שפה והבנת הקשרים ארוכים על בסיס ספרות קלאסית בכמה שפות שונות.

  • הערכת מודלים על הקשר ארוך

    בדיקת היכולת של מודלים להתמודד עם טקסטים מלאים של ספרים ללא קיטוע.

  • מחקר בלשני והיסטורי

    ניתוח התפתחות סגנונות כתיבה ואוצר מילים במאות קודמות.

איפה זה נופל

הטקסטים מגיעים כולם מרשות הרבים ההיסטורית, מה שאומר שפה ישנה מאוד, סגנון ספרותי של המאה התשע עשרה ומטה, והיעדר מוחלט של שפה מודרנית או סלנג עכשווי. עברית לא קיימת כאן בכלל, והמאגר מוגבל לשפות כמו אנגלית, צרפתית, גרמנית וסינית.

בעיה טכנית נוספת היא תגיות הפתיחה והסיום שנשארו בתוך הטקסט. אם לא תנקו אותן במפורש, המודל שלכם ילמד לפלוט משפטי זכויות יוצרים של גוטנברג באמצע תשובות.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. המאגר מכיל רק את השפות שפורטו בכרטיס, ביניהן אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, הולנדית, פולנית, פורטוגזית, רוסית, שוודית וסינית.

האם מותר להשתמש בזה למוצר מסחרי?

אפשר, אבל יש מלכודת משפטית. כדי לפעול מסחרית בלי לשלם תמלוגים לפרויקט גוטנברג, אתם חייבים למחוק מהטקסטים את כל האזכורים לשם הפרויקט ואת הרישיון המקורי שלו.

איך בנויים הנתונים בתוך הקבצים?

המידע שמור בפורמט פארקט ומחולק לפי שפות. כל רשומה מכילה ספר שלם אחד, כולל הערות פתיחה וסיום של הפרויקט.

האם הטקסטים מוכנים מיד לאימון?

לא לגמרי. תצטרכו לכתוב סקריפט ניקוי שיאתר את התגיות שמסמנות את תחילת וסוף הספר כדי להעיף את החלקים המנהלתיים שנמצאים שם.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות פקודת load_dataset רגילה, ומגדירים את השפה הרצויה בפרמטר split, למשל אנגלית או צרפתית. מאחר שמדובר בספרים שלמים שנפרסים על פני 71 קבצים בפורמט פארקט, מומלץ מאוד לעבוד במצב של הזרמה כדי לא לחנוק את הזיכרון כבר בהתחלה.

אין צורך לבקש אישור גישה מיוחד, המאגר פתוח להורדה ישירה. השדה המרכזי שמעניין אתכם הוא גוף הטקסט עצמו, אך תצטרכו להסיר ידנית את הפתיחים והסיומות שמופיעים בכל ספר לפני שאתם מתחילים בתהליך האימון.

from datasets import load_dataset

ds = load_dataset("manu/project_gutenberg")

הרישיון

הרישיון הרשמי לא הוגדר בהאגינג פייס, אבל הטקסטים עצמם כפופים לרישיון של פרויקט גוטנברג. הרישיון דורש תשלום תמלוגים ומטיל הגבלות אם אתם משתמשים בסימן המסחרי שלהם למטרות מסחריות, אך מותר להפיץ את הספרים בחופשיות אם מסירים כל אזכור לשם הפרויקט ולרישיון המקורי.

הרישיון המלא ב־Hugging Face ↗