GPT
F

French-PD-Newspapers

קוד פתוח

PleIAsרישיון לא דווח2024-01-25

  • ocr

מאגר עצום של עיתונות צרפתית היסטורית בנחלת הכלל עם קרוב לשלושה מיליון גליונות. מתאים בעיקר לאימון מודלי שפה בצרפתית ממקור חופשי מזכויות יוצרים.

  • 3,360הורדות בחודש
  • 70לייקים

מה זה

המאגר מאגד קרוב לשלושה מיליון גליונות של עיתונים וכתבי עת בצרפתית, שכוללים יחד כמעט 70 מיליארד מילים. כל החומרים נאספו מתוך פרויקט Gallica של הספרייה הלאומית הצרפתית, בהתבסס על עבודה קודמת שנעשתה עבור מיזם Gallicagram ובשיתוף פעולה עם OpenLLMFrance.

הסינון מתבסס על דיני נחלת הכלל בצרפת, שכוללים פרסומים קולקטיביים מלפני יותר מ־70 שנה או יצירות של מחברים שנפטרו לפני יותר מ־70 שנה. התוכן מפוזר על פני 322 קבצים, כשבכל קובץ יש טקסט מלא של כמה אלפי גליונות שנבחרו באקראי יחד עם מטא-דאטה בסיסי כמו מזהה Gallica, כותרת, מחבר וספירת מילים.

מתאים ל

  • אימון מודלי שפה בצרפתית

    מקור טקסטואלי עצום בהיקפו לבניית מודלי בסיס פתוחים בצרפתית.

  • מחקר היסטורי וכמותני

    ניתוח מגמות לשוניות ותהליכים תרבותיים על פני עשרות שנים של עיתונות.

  • פיתוח כלי תיקון OCR

    אימון מערכות לזיהוי ותיקון שגיאות סריקה אוטומטית בטקסטים היסטוריים.

איפה זה נופל

כל הטקסטים עברו המרה אוטומטית באמצעות תוכנות זיהוי תווים אופטי, שרבות מהן פעלו על סריקות שנעשו עוד מאמצע שנות האלפיים, ולכן יש שגיאות קריאה רבות בטקסט. המבנה המקורי של העמודים כולל רעשים כמו כותרות עליונות, מספרי עמודים וטבלאות שלא פורמטו כראוי בגלל טורי העיתון. בנוסף, מדובר רק בצרפתית היסטורית ללא שום ייצוג לעברית, והתוכן משקף את העמדות והסגנון של עיתונות ישנה, כך שהוא דורש סינון קפדני לפני שילוב במודל מודרני.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

זה מורכב וכולל סיכון משפטי מסוים. יוצרי המאגר טוענים שהטקסטים שייכים לנחלת הכלל לפי החוק האירופי, אך הספרייה הלאומית הצרפתית דורשת תשלום ורישיון מיוחד עבור שימוש שמייצר הכנסות. אם אתם בונים מוצר מסחרי, כדאי לבדוק את התנאים מול הספרייה ולא להסתמך רק על הגדרת נחלת הכלל.

האם יש במאגר טקסטים בעברית?

לא, המאגר כולל אך ורק עיתונות בצרפתית. כל החומרים מגיעים מארכיוני הספרייה הלאומית בצרפת ומוגדרים תחת שפת המקור הצרפתית בלבד. מי שמחפש מקורות היסטוריים בעברית יצטרך לפנות לפרויקטים ישראליים מקבילים כמו עיתונות יהודית היסטורית.

איך נאסף הטקסט ומה רמת האיכות שלו?

הקבצים נסרקו ועברו זיהוי תווים אופטי לאורך שנים רבות על ידי הספרייה הלאומית הצרפתית. בגלל שמדובר בסריקות ישנות, יש לא מעט שגיאות זיהוי ושיבושים במבנה של טבלאות וטורים. המפרסמים מציינים שיידרש ניקוי ועיבוד נוסף כדי להביא את הטקסט לרמה מודרנית גבוהה.

במה המאגר הזה שונה ממאגרי אימון אחרים?

בניגוד לסריקות רשת רגילות שכוללות תוכן אינטרנטי עכשווי, כאן מדובר בטקסט היסטורי מסודר מעיתונים וכתבי עת בני יותר משבעים שנה. ההיקף שלו מגיע לכמעט 70 מיליארד מילים, מה שהופך אותו לאחד ממאגרי נחלת הכלל הגדולים ביותר שקיימים בשפה הצרפתית.

איך טוענים

המאגר יושב בפורמט Parquet ומחולק ליותר מ־300 קבצים נפרדים, כך שאפשר לטעון אותו ישירות בקוד או לקרוא רק חלק מהקבצים. אין צורך באישור גישה כדי להתחיל לעבוד איתו. השדות המרכזיים בכל רשומה כוללים את הטקסט המלא לצד מזהה Gallica, כותרת ומחבר, ומי שצריך נתונים נוספים יכול למשוך אותם דרך ה־API של הספרייה הלאומית הצרפתית.

from datasets import load_dataset

ds = load_dataset("PleIAs/French-PD-Newspapers")

הרישיון

היוצרים מגדירים את היצירות כנחלת הכלל לפי חוקי זכויות היוצרים והדירקטיבה האירופית, אך שדה הרישיון הרשמי לא דווח במאגר. הספרייה הלאומית הצרפתית טוענת בתקנון שלה להגבלת שימוש מסחרי ומבקשת תשלום על שירותים שמייצרים הכנסה ישירה. המצב המשפטי הזה יוצר אי-ודאות לגבי שימוש במודלים מסחריים, וכדאי לקחת בחשבון את הסיכון לפני אימון מערכת עסקית.

הרישיון המלא ב־Hugging Face ↗