GPT
B

britannica-illustrated-pages

קוד פתוח

biglamother2026-08-24

  • cultural-heritage
  • historical-documents
  • illustrations
  • book-illustrations
  • encyclopaedia-britannica

מעל מאה אלף עמודי אנציקלופדיה סרוקים עם איורים משולבים בתוך טקסט מהשנים 1768 עד 1929. המאגר מאפשר לאמן מודלים על דיאגרמות היסטוריות ותרשימים שרוב הסינונים האוטומטיים מפספסים לחלוטין.

  • 6,773הורדות בחודש
  • 48לייקים

מה זה

המאגר כולל סריקות של אנציקלופדיה בריטניקה מהמהדורה הראשונה ועד ה־14, שנלקחו מתוך כמעט מיליון עמודים בספריית אינטרנט ארכיב. המקורות נסרקו מכ־1,160 כרכים שנמסרו מספריות שונות, כולל הספרייה הלאומית של סקוטלנד, הרווארד וקורנל. במקום להתמקד רק בלוחות איור שלמים, מודל קל סיווג את העמודים ושלף איורים שיושבים בתוך עמודי טקסט רגילים, שמהווים 82 אחוזים מהחומר.

הנתונים מחולקים לשלוש תצורות עיקריות. הראשונה היא pages, שמכילה 115,293 עמודים שאותרו כמאוירים עם תמונות מוקטנות ומטא-דאטה. השנייה היא manifest, שמכילה 975,345 שורות ללא תמונות עבור כל עמוד שנסרק, כולל ציון הסיווג ומספר מילים מה־OCR. התצורה השלישית, crop_masks, מחזיקה פוליגונים ותיבות תוחמות ברזולוציה מלאה לזיהוי וחיתוך של כ־700 אלף איורים בודדים.

מתאים ל

  • אימון זיהוי אובייקטים היסטורי

    זיהוי וחיתוך חיתוכי עץ, תחריטים ודיאגרמות עתיקות מתוך סריקות ספרים מורכבות.

  • הערכת מודלי OCR ומולטימודל

    בדיקת יכולת המודל לחלץ טקסט מעמודים שמשלבים איורים צפופים עם עמודות מודפסות ישנות.

  • מחקר היסטורי כמותי

    ניתוח השינוי בשיעור האיורים והנושאים המדעיים לאורך 160 שנות פרסום האנציקלופדיה.

איפה זה נופל

הסיווג והמסכות הם פלטים של מודלים ולא תיוג אנושי מלא, כך שיש שגיאות זיהוי. המדגם שקבע את הסף כלל רק 347 עמודים. מהדורות 9 ו־11 מופיעות בכמה עותקים מספריות שונות ודורשות ניקוי כפילויות ידני לפי מהדורה וכרך. שנת הפרסום חסרה ב־9 אחוזים מהעמודים, שדה התורם ריק בשליש מהמקרים, ושם המהדורה נוחש לפי שנה ב־46 אחוזים מהרשומות. כל החומר באנגלית ישנה, והמסכות נוטות לפספס דיאגרמות קטנות או למזג איורים צפופים מדי.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצרים מסחריים?

הטקסטים והאיורים המקוריים פורסמו לפני 1930 והם ברשות הציבור. ברמת הרשומות של אינטרנט ארכיב יש שונות בהגדרות הרישיון, אך היצירות עצמן פטורות מזכויות יוצרים. יש להקפיד על מתן קרדיט לספרייה הסורקת הרשומה בכל עמוד.

כמה שוקל הדאטהסט ואיך מתמודדים עם הנפח?

קובץ המטא-דאטה שוקל כ־120 מגה-בייט, ומאגר התמונות המוקטנות תופס כ־9.6 גיגה-בייט. הסריקות ברזולוציה מלאה שמורות בבאקט חיצוני ואינן חלק מההורדה הישירה. מומלץ לעבוד במצב הזרמה כדי למשוך רק את הדוגמאות הרלוונטיות לעבודה שלכם.

האם יש במאגר עברית?

לא. כל 1,160 הכרכים נכתבו והודפסו באנגלית בריטית היסטורית מהמאות ה־18 עד תחילת ה־20. המאגר מתאים לחקר השפה האנגלית או לראייה ממוחשבת כללית, אך אינו מכיל תוכן בעברית.

איך סוננו העמודים מתוך כמעט מיליון סריקות?

מודל סיווג תמונה בשם efficientvit_b1 רץ על כל העמודים וניבא את הסיכוי לקיום איור. החוקרים הגדירו ספי ניקוד שונים לעמודי טקסט צפופים ולעמודים עם מעט מלל, וכך שלפו את העמודים המאוירים ללא צורך בסקירה ידנית של כל החומר.

איך טוענים

טוענים את המידע דרך ספריית datasets הרגילה של Hugging Face. קובץ ה־manifest שוקל כ־120 מגה-בייט ומתאים לבניית חלוקות חדשות, בעוד תצורת pages דורשת כ־9.6 גיגה-בייט ומומלץ להזרים אותה במקום להוריד הכל מראש. אין צורך בבקשת אישור גישה. התמונות המוטמעות הן קובצי JPEG מוקטנים לרוחב 600 פיקסלים, אך כל שורה מפנה לסריקה המקורית ברזולוציה מלאה דרך bucket_url. שדות מפתח שכדאי לבדוק בטעינה הם p_illustrated לציון המודל, edition למהדורה, ו־stratum כדי להבדיל בין עמודי טקסט לעמודי תמונה בלבד.

from datasets import load_dataset

ds = load_dataset("biglam/britannica-illustrated-pages")

הרישיון

הרישיון מוגדר כ־other. ספרי הבריטניקה שנסרקו פורסמו בין 1768 ל־1929 ולכן נמצאים ברשות הציבור לפי הדין האמריקאי עקב גילם. עם זאת, רשומות המקור באינטרנט ארכיב כוללות סימוני רישוי משתנים, מנחלת הכלל ועד CC-BY או שדות ריקים. בפועל החומר הבסיסי חופשי מזכויות יוצרים, אך חובה לתת ייחוס לספרייה התורמת בכל שימוש או אימון מודל.

הרישיון המלא ב־Hugging Face ↗