GPT
U

US-PD-Books

קוד פתוח

storytracercc0-1.02024-02-18

  • books
  • public domain
  • ocr
  • open culture

מאגר מטא-דאטה של מעל 650 אלף ספרים באנגלית שנסרקו בארכיון האינטרנט. הטקסטים המלאים הוסרו בעקבות דרישת הארכיון, כך שנשארו רק הרשומות הביבליוגרפיות.

  • 4,321הורדות בחודש
  • 191לייקים

מה זה

המאגר תוכנן להכיל 653,983 ספרי סריקה באנגלית שנחשבו בנחלת הכלל בארצות הברית, בהיקף של כ־61 מיליארד מילים. סבסטיאן מייסטורוביץ אסף את הרשומות מאוספי ארכיון האינטרנט וסינן אותן בעזרת רשומות פרויקט Open Library כדי לוודא שמדובר בספרים אמיתיים ולא במסמכים אחרים. הסינון התבסס על אוספים שהוגדרו מראש כנחלת הכלל, כמו ספריית אוניברסיטת קורנל, ועל שאילתות API שחיפשו פריטים ללא זכויות יוצרים.

בפועל, ארכיון האינטרנט פנה וביקש למחוק את המאגר מפני שהמטא-דאטה שלו אינו אמין מספיק לקביעת מעמד זכויות היוצרים של היצירות. בעקבות זאת הוסרו כל הטקסטים המלאים של הספרים. כרגע המאגר מכיל רק תיעוד ומטא-דאטה שכוללים כותר, מחבר, שנת הוצאה, מזהי ארכיון ומספר עמודים.

מתאים ל

  • ניתוח מטא-דאטה היסטורי

    מיפוי מחברים, שנות הוצאה וכותרים באנגלית מתוך רשומות סריקה ישנות.

  • הצלבת רשומות ביבליוגרפיות

    קישור בין מזהי Internet Archive לבין מזהי Open Library לצרכי מחקר וקטלוג.

  • איתור מקורות לסריקה עצמאית

    שימוש ברשימת הכתובות והמזהים כדי לבדוק באופן פרטני זכויות בספריות מקור.

איפה זה נופל

הבעיה המרכזית והקריטית היא שאין כאן טקסטים לאימון. ארכיון האינטרנט בעצמו הודיע שהמידע על זכויות היוצרים לא אמין, מה שיוצר סיכון משפטי ממשי סביב היצירות שהיו בו.

איכות התוכן המקורי נשענה על OCR של ארכיון האינטרנט, שמשתנה מאוד בין ספר לספר וכולל שגיאות סריקה. בנוסף, המאגר מוגבל לאנגלית בלבד ללא שום ייצוג לעברית, ומכיל ספרים היסטוריים עם פערי שפה ותוכן שאינם משקפים כתיבה מודרנית.

שאלות
נפוצות

האם אפשר להשתמש במאגר כדי לאמן מודל שפה?

לא. הטקסטים המלאים של הספרים הוסרו לחלוטין מהמאגר בעקבות דרישת ארכיון האינטרנט. נשאר רק קובץ מטא-דאטה, כך שאין טקסט להזנה למודל.

האם המאגר כולל ספרים בעברית?

לא. כל הספרים שנאספו סווגו על ידי ארכיון האינטרנט כבעלי שפה ראשית אנגלית. ייתכן שחלק קטן כולל מילים בודדות בשפות אחרות, אך אין בו תוכן עברי.

מה ההבדל בינו לבין LoC-PD-Books של אותו יוצר?

בעקבות הסרת הטקסטים כאן, היוצר בנה מאגר נפרד בשם LoC-PD-Books שמכיל טקסט מלא של כ־140 אלף ספרים. המאגר ההוא מבוסס ישירות על ספריית הקונגרס, שהגדירה אותם רשמית כנחלת הכלל.

האם מותר להשתמש במטא-דאטה לצרכים מסחריים?

כן, המטא-דאטה והתיעוד מפורסמים תחת רישיון cc0-1.0 שמוותר על זכויות היוצרים. אפשר לשלב את הנתונים במוצרים מסחריים ומחקריים ללא תשלום או מתן קרדיט.

איך טוענים

אין צורך בבקשת גישה מיוחדת, המאגר פתוח. במקור הוא שקל כ־220 גיגה-בייט דחוסים ב־327 קובצי Parquet, וכ־400 גיגה-בייט ללא דחיסה. כיום המאגר כולל שלושה קבצים בלבד, ובהם metadata.parquet.

טוענים את הקובץ ישירות כדי לקרוא את השדות ocaid, title, author, year, page_count ומזהי Open Library. שדה הטקסט המלא אינו זמין יותר בקבצים הנוכחיים.

from datasets import load_dataset

ds = load_dataset("storytracer/US-PD-Books")

הרישיון

המאגר מופץ ברישיון cc0-1.0, שמקביל לנחלת הכלל ומאפשר שימוש מסחרי, שינוי והפצה ללא חובת ייחוס. עם זאת, הרישיון חל רק על המטא-דאטה שנשאר במאגר ולא הכשיר את הטקסטים המלאים שהוסרו בגלל ספקות לגבי זכויות היוצרים המקוריות שלהם בארצות הברית.

הרישיון המלא ב־Hugging Face ↗