GPT
B

bookcorpus

קוד פתוח

bookcorpusunknown2022-03-02

טקסט רציף של אלפי ספרים באנגלית שנאספו לצורכי אימון מודלי שפה. הוא מתאים למי שחוקר היסטוריה של מודלים כמו ברט ורוצה לשחזר ארכיטקטורות קלאסיות.

  • 3,494הורדות בחודש
  • 362לייקים

מה זה

המאגר כולל 74,004,228 שורות טקסט בפורמט פשוט של שדה יחיד בשם text, המחולק לקובצי ספרים שלמים. הטקסטים נאספו באמצעות סריקה של אתר סמאשוורדס, שבו סופרים מפרסמים ספרים עצמאיים בחינם. במקור הוצהר על מעל 11,000 ספרים, אך בדיקות מאוחרות מראות שיש בו לכל היותר 7,185 ספרים ייחודיים.

הסינון המקורי התבסס על ספרים חינמיים באנגלית באורך של מעל 20,000 מילים לפי ממשק האתר. בפועל, החוקרים מצאו שמאות קבצים נחתכו וכוללים פחות מהרף הזה, ובנוסף קיימים 98 קבצים ריקים לחלוטין. כל הנתונים נמצאים בחלוקת אימון אחת ללא חלוקה מוגדרת למבחן או אימות.

מתאים ל

  • אימון מודלי מסכות שפה

    משמש לאימון מודלים שמנחשים מילים חסרות בטקסט רציף, בדומה לתהליך המקורי של ברט.

  • מחקר על דליפת זכויות יוצרים

    מאפשר לבדוק שינון טקסטים מוגנים במודלי שפה ישנים לעומת מודלים חדשים.

  • שחזור ניסויי עבר באנגלית

    מתאים לחוקרים שמנסים לקבל תוצאות זהות למאמרים שפורסמו סביב שנת 2015.

איפה זה נופל

האיכות סובלת מכפילויות כבדות, כאשר 2,930 ספרים מופיעים יותר מפעם אחת וחלקם משוכפלים עד חמש פעמים. הניקוי היה חלקי בלבד, והטקסט מלא בהודעות זכויות יוצרים של סופרים, אזהרות פיראטיות וכתובות אימייל פרטיות. מבחינת ייצוג, מדובר במדגם נוחות שמכסה רק כ־2% מהספרים שהיו באתר ב־2014, רובם מסוגות ספציפיות כמו רומנטיקה ומדע בדיוני. אי אפשר להכניס את הדאטהסט הזה למוצר בלי ניקוי יסודי של עותקים כפולים ומשפטי מערכת.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

הרישיון מוגדר כלא ידוע ואינו מספק הגנה משפטית. הספרים נלקחו ללא אישור היוצרים, ורבים מהם כוללים איסור מפורש על שימוש שאינו אישי. שימוש מסחרי עלול לחשוף אתכם לתביעות של בעלי הזכויות.

כמה מקום בדיסק המאגר תופס בפועל?

קובץ ההורדה דורש 1.18 גיגה בייט של תעבורה. לאחר הפריסה והעיבוד המקומי, המאגר תופס 4.85 גיגה בייט נוספים. סך כל נפח האחסון הנדרש במחשב הוא 6.03 גיגה בייט.

האם הדאטהסט כולל טקסטים בעברית?

המאגר כולו מורכב מספרים שנכתבו באנגלית בלבד. אין בו שום ייצוג לעברית או לשפות אחרות. אם המטרה שלכם היא מודל רב-לשוני, תצטרכו להביא מקורות נפרדים לחלוטין.

איך אספו את הספרים האלה?

החוקרים הפעילו סקריפט סריקה אוטומטי על אתר סמאשוורדס בשנת 2015. הם הורידו ספרים חינמיים בפורמט קובצי אי-פאב שהוגדרו מעל עשרים אלף מילים, והמירו אותם לקובצי טקסט שטוחים. המחברים לא קיבלו הודעה ולא נתנו את הסכמתם לתהליך.

למה להשתמש בו במקום במאגרי ספרים חדשים?

היתרון העיקרי הוא שימור היסטורי לצורכי השוואה מדויקת למאמרים ישנים. מודלים מוקדמים נשענו בדיוק על הנתונים האלה, ולכן חוקרים משתמשים בו כדי לשחזר ארכיטקטורות. לכל פרויקט חדש עדיף לחפש חלופות נקיות ומורשות יותר.

איך טוענים

טוענים את הדאטהסט ישירות דרך ספריית datasets באמצעות המזהה bookcorpus/bookcorpus. אין צורך באישור גישה או בהרשמה מיוחדת. גודל הקבצים להורדה עומד על 1.18 גיגה בייט, ובפריסה מלאה על הדיסק המאגר תופס 4.85 גיגה בייט, כך שסך השטח הנדרש מגיע לכ־6.03 גיגה בייט. המבנה מינימליסטי ומכיל מחרוזות טקסט בלבד, ללא מטא-דאטה נלווה.

from datasets import load_dataset

ds = load_dataset("bookcorpus/bookcorpus")

הרישיון

הרישיון מוגדר כלא ידוע. הספרים נסרקו מהרשת ללא הסכמת המחברים, וחלקם הגדול כולל תנאי שימוש מפורשים שאוסרים הפצה מסחרית או העתקה. שימוש במאגר הזה לאימון מודל מסחרי חושף אתכם לסיכונים משפטיים של הפרת זכויות יוצרים, ואין שום ודאות שמותר להפיץ תוצרים שמתבססים עליו.

הרישיון המלא ב־Hugging Face ↗