GPT
F

French-PD-Books

קוד פתוח

PleIAsרישיון לא דווח2024-01-22

  • ocr

מאגר ענק של 289,000 ספרים בצרפתית ברשות הציבור מהספרייה הלאומית בצרפת. הוא מתאים למי שרוצה לאמן מודלים שפתיים על טקסט היסטורי וספרותי בלי להסתבך עם זכויות יוצרים של יצירות מודרניות.

  • 2,958הורדות בחודש
  • 52לייקים

מה זה

המאגר כולל מעל 16 מיליארד מילים של מונוגרפיות מתוך פרויקט Gallica של הספרייה הלאומית של צרפת. הוא מכיל יצירות שמחבריהן הלכו לעולמם לפני יותר מ־70 שנה, בהתאם לחוקי זכויות היוצרים האירופיים. הטקסטים נאספו בסיוע צוות פרויקט Gallicagram ו־OpenLLMFrance כדי לאפשר מחקר ואימון מודלים.

הנתונים מחולקים לקובצי Parquet שונים, כאשר כל קובץ מאגד טקסט מלא של 2,000 ספרים שנבחרו אקראית. לצד הטקסט המלא, כל רשומה כוללת מטא-דאטה בסיסי כמו מזהה Gallica, כותרת, שם המחבר ומספר המילים, וניתן להרחיב את המידע הזה באמצעות ממשק ה־API של הספרייה הלאומית.

מתאים ל

  • אימון מודלי שפה בצרפתית

    הרחבת בסיס הטקסט של מודלים גדולים עם מיליארדי מילים בצרפתית ממקורות ספרותיים.

  • מחקר היסטורי וספרותי

    ניתוח מגמות לשוניות וסמנטיות לאורך מאות שנים, בדומה לשימוש בפרויקט Gallicagram.

  • אימון מודלים לתיקון OCR

    בדיקה ופיתוח של שיטות לתיקון שגיאות סריקה על בסיס מודלים לשוניים קיימים.

איפה זה נופל

הטקסטים כולם נסרקו בטכנולוגיית OCR ממוחשבת שנפרסה מאז אמצע שנות האלפיים, ולכן תמצאו בהם לא מעט שגיאות סריקה, מילים שבורות ורעש. מבנה העמודים המקורי מייצר בעיות נוספות: כותרות עליונות, מספרי עמודים, טבלאות ופסקאות מרובות טורים לא מופרדים כמו שצריך מהטקסט הרציף. בנוסף, המאגר כולל צרפתית בלבד, ומשקף שפה של ספרות ישנה שאינה דומה לצרפתית מודרנית או לטקסט אינטרנטי.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

הטקסטים עצמם נמצאים ברשות הציבור, אבל הספרייה הלאומית של צרפת מגדירה בתנאיה ששימוש מסחרי ישיר מחייב תשלום ורישיון מולם. בכרטיס המאגר לא מופיע רישיון אחיד. אם אתם בונים מודל שמיועד למכירה או לשירות בתשלום, כדאי לבדוק את זה מול גורם משפטי לפני האימון.

האם יש במאגר טקסטים בעברית?

לא. המאגר מכיל ספרים בצרפתית בלבד, כולם מתוך האוספים של הספרייה הלאומית הצרפתית.

איך הטקסטים נאספו ועובדו?

הספרים נסרקו על ידי הספרייה הלאומית של צרפת מאז אמצע שנות האלפיים והומרו לטקסט באמצעות תוכנות OCR. יוצרי המאגר חילקו את הספרים לקובצי Parquet, כאשר כל קובץ מכיל 2,000 כותרים שנבחרו באופן אקראי.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

הנתונים מחולקים ל־147 קובצי Parquet שונים תחת שמות כמו gallica_mono_1.parquet. ניתן לטעון אותם בקלות בפייתון עם ספריות כמו Pandas או Datasets, ולגשת ישירות לטקסט המלא ולמטא-דאטה המצורף.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות קריאה לקובצי ה־Parquet, המחולקים ל־147 קבצים שונים. אין צורך באישור גישה מוקדם, המאגר פתוח לחלוטין. כדאי לשים לב שכל קובץ מכיל אלפיים ספרים עם טקסט מלא, כך שמדובר בנפח עיבוד משמעותי, והשדות המרכזיים לעבודה הם מזהה הספר, שם המחבר, הכותר והטקסט.

from datasets import load_dataset

ds = load_dataset("PleIAs/French-PD-Books")

הרישיון

המצב המשפטי כאן מורכב. היוצרים מציינים שהיצירות עצמן נמצאות ברשות הציבור לפי הדין האירופי, אך הספרייה הלאומית הצרפתית דורשת ברישיון השימוש שלה תשלום והסדרה על שימוש מסחרי שמניב הכנסות. בכרטיס המאגר לא הוגדר רישיון רשמי סגור, ולכן שימוש מסחרי במודל שמאומן על הנתונים עלול לחשוף אתכם לדרישות משפטיות מצד הספרייה.

הרישיון המלא ב־Hugging Face ↗