GPT
B

british-library-book-images

קוד פתוח

biglamcc0-1.02026-08-06

  • image
  • digital-humanities-research
  • glam
  • book-illustration

המאגר מכיל 1,080,814 גזרי תמונות מתוך עשרות אלפי ספרים שנסרקו בספרייה הבריטית. הוא מתאים למי שרוצה לאמן מודלים על איורים היסטוריים ועיטורי דפוס ללא מגבלות זכויות יוצרים.

  • 8,028הורדות בחודש
  • 62לייקים

מה זה

הנתונים כוללים קבצי תמונה בפורמט JPEG שנחתכו מתוך כ־25 מיליון עמודי ספרים שפורסמו בין השנים 1510 ל־1900. הספרים נסרקו בשיתוף מיקרוסופט ומכסים תחומי גאוגרפיה, פילוסופיה, שירה, היסטוריה וספרות במספר שפות, כאשר כל רשומה כוללת את התמונה, שנת הפרסום, שם הקובץ המקורי וסוג התמונה.

האוסף מחולק לארבע קטגוריות שנבחרו על ידי אלגוריתם: עיטורים (embellishments) עם 416,935 פריטים, לוחות מלאים (plates) עם 385,231 פריטים, גזרים בינוניים (medium) עם 217,100 פריטים, וכריכות (covers) עם 61,548 פריטים. החלוקה מבוססת על היוריסטיקה של גודל ומיקום בעמוד ולא על קטלוג אמנותי מקצועי, ולכן הגבולות בין הקטגוריות מטושטשים.

בנוסף לתמונות, המאגר מציע קונפיגורציה של וקטורי SigLIP2 בגודל 1152 ממדים לכל תמונה עבור חיפוש טקסטואלי, ומסכות חיתוך (crop_masks) שנוצרו באמצעות מודל כדי להפריד את האיורים משאריות טקסט שליוו את הגזירים המקוריים.

מתאים ל

  • אימון מחוללי תמונות היסטוריים

    לימוד סגנונות תחריט, איור ועיטורים ספרותיים מן המאה ה־19 עבור מודלי text-to-image.

  • חיפוש ויזואלי בספריות

    שימוש בווקטורי SigLIP2 המוכנים להקמת מנוע חיפוש טקסטואלי חופשי על פני מיליון איורים עתיקים.

  • סגמנטציה ועיבוד מסמכים

    הערכה ואימון של מודלי זיהוי אובייקטים לבידוד איורים וכותרות מתוך סריקות עמודי ספר ישנים.

איפה זה נופל

ההטיה המרכזית היא כרונולוגית: שנות התשעים של המאה ה־19 לבדן מהוות כשליש מכלל החומר, וכל מה שלפני שנת 1800 מרכיב רק כ־1.6% מהאוסף. לוחות שלמים כמעט אינם קיימים לפני המאה ה־19, כך שמודל שיאומן כאן ילמד בעיקר את סגנון האיור הוויקטוריאני המאוחר.

איכות הנתונים דורשת סינון מוקדם. שדה השנה הוא מחרוזת, כאשר 5,291 רשומות מוגדרות Unknown וכ־2,151 רשומות מציגות שנים שגויות אחרי 1900, עד שנת 1946. החיתוכים המקוריים רופפים ומכילים לעיתים קרובות טקסט חי מהספר וכתוביות, והתכנים מתקופת הקולוניאליזם הבריטי כוללים ייצוגים היסטוריים שלא עברו בדיקה או סינון של תוכן פוגעני.

שאלות
נפוצות

האם מותר להשתמש בתמונות ובמודלים שמאומנים עליהן למוצר מסחרי?

כן. החומרים פורסמו תחת Public Domain ותיוג cc0-1.0, כך שאין מניעה משפטית לשלב אותם במוצרים מסחריים. אין חובת קוד פתוח למודל שתאמנו ואין דרישת רישוי נגזרת.

כמה המאגר שוקל והאם חייבים להוריד את כולו?

הנפח הכולל של התמונות הוא כ־621 גיגה-בייט. לא חייבים להוריד הכל, אפשר להזרים דגימות לפי צורך, להוריד רק קונפיגורציה מסוימת מתוך הארבע, או לעבוד עם קובצי ה־Parquet דרך שאילתות DuckDB בלי למשוך את התמונות.

האם יש במאגר איורים מספרים בעברית?

התיעוד מציין שהספרים כוללים מספר שפות אירופיות ומקורם באוספי הספרייה הבריטית, אך אינו מפרט חלוקה מדויקת לפי שפה. כדי לאתר טקסט או ספרים בעברית יש להצליב את מספרי המערכת בקובץ עם מאגר ה־OCR המקביל blbooks-parquet.

איך נוצרו התמונות והאם החיתוך סביב האיור מדויק?

התמונות נחתכו אוטומטית מעמודי הספרים באמצעות תוכנת ABBYY ללא מגע יד אדם. החיתוך המקורי נוטה להיות רחב ולכלול פסקאות וכתוביות, אך המאגר כולל קונפיגורציית crop_masks עם תחזיות מודל המאפשרות להדק את החיתוך לאיור בלבד.

איך טוענים

נפח המאגר כולו מגיע לכ־621 גיגה-בייט בפורמט Parquet, כך שהדרך המעשית לעבוד איתו בסביבת פיתוח היא הזרמה (streaming) ישירות דרך הספרייה של Hugging Face, או שימוש ב־DuckDB כדי לשלוף מטא-דאטה ומסכות בלי להוריד את קובצי התמונה עצמם. אין צורך באישור גישה מיוחד כדי להתחיל.

השדות העיקריים הם image שמחזיק את הביטים של התמונה, fname שממנו אפשר לחלץ את מזהה המערכת לחיבור עם טקסט ה־OCR המקורי, date שמכיל את שנת הפרסום כמחרוזת ולא כמספר, ו־image_type. בקונפיגורציית המסכות תמצאו את masks_rle ואת objects שמכיל ציוני ביטחון וקואורדינטות של תיבות תוחמות.

from datasets import load_dataset

ds = load_dataset("biglam/british-library-book-images")

הרישיון

המאגר מתויג ברישיון cc0-1.0 המקביל לרשות הציבור (Public Domain). היצירות המקוריות אינן מוגנות עוד בזכויות יוצרים, והספרייה הבריטית שחררה את הסריקות ללא מגבלות שימוש, כך שניתן לאמן עליהן מודלים חופשיים או מסחריים בלי חובת שיתוף זהה. ציון מקור לטובת הספרייה הבריטית הוא נוהג מקובל אך אינו מהווה דרישה משפטית מחייבת ברישיון זה.

הרישיון המלא ב־Hugging Face ↗