GPT
G

german-commons

קוד פתוח

coral-nlpodc-by2025-10-13

  • german
  • commons
  • legal
  • scientific
  • cultural

אוסף ענק של טקסט בגרמנית עם 154.56 מיליארד טוקנים ברישיונות פתוחים. הוא נבנה במיוחד לאימון מודלי שפה שצריכים כיסוי נרחב של השפה הגרמנית בלי להסתבך עם זכויות יוצרים עמומות ברשת.

  • 2,832הורדות בחודש
  • 39לייקים

מה זה

המאגר מאגד 35.78 מיליון מסמכים מתוך 41 מקורות שונים, ומחולק לשבעה תחומים. החלקים הגדולים ביותר הם חדשות עם 72.67 מיליארד טוקנים וטקסטים תרבותיים והיסטוריים עם 54.49 מיליארד טוקנים. שאר החומר מתחלק בין תוכן רשת כמו ויקיפדיה, תמלילי יוטיוב וקוד, לצד מסמכים פוליטיים, מאגרי משפט ופסיקה, מעט תוכן כלכלי ומאמרים מדעיים.

כל רשומה מגיעה עם הטקסט המלא שעבר ניקוי כפילויות, סינון איכות ואחידות בקידוד, יחד עם מזהה, שם המקור והתחום. בנוסף, המפרסמים צירפו מטא-דאטה מועיל לכל מסמך: מספר הטוקנים לפי GPT-2, מדד פרפלקסיטי שנמדד באמצעות KenLM שאומן על ויקיפדיה הגרמנית, ציון איכות פענוח OCR שנמדד עם OCRoscope, ורשימת הרישיונות הרלוונטיים למסמך.

מתאים ל

  • אימון מקדים למודלי שפה

    בסיס רחב ומגוון של 154 מיליארד טוקנים לאימון מקדים של מודלי שפה ייעודיים לגרמנית.

  • אימון מודלים לתחום המשפטי

    שימוש בתת המאגר המשפטי הכולל מיליארדי טוקנים של פסיקה וחקיקה לבניית מודלים ייעודיים למשפט הגרמני.

  • מחקר היסטורי ובלשני

    ניתוח שינויי שפה וסגנון לאורך זמן על גבי עשרות מיליארדי טוקנים של עיתונות וספרות היסטורית.

איפה זה נופל

הבעיה הבולטת ביותר היא ההטיה ההיסטורית. חלק ניכר מהמאגר, בעיקר באגפי החדשות והתרבות, מגיע מארכיונים ישנים ומסמכים סרוקים. הטקסטים האלה עברו פענוח OCR, ולמרות שיש ציון איכות ייעודי, סריקות ישנות גוררות שגיאות זיהוי אותיות, איות ארכאי ומבני משפטים שלא מייצגים גרמנית מודרנית. בנוסף, המאגר מוגבל אך ורק לגרמנית. אם אתם בונים מודל כללי או רב לשוני, תצטרכו לערבב אותו עם מקורות נוספים, ולסנן היטב טקסטים בעלי ציוני פרפלקסיטי חריגים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

האגרגציה עצמה מופצת תחת רישיון ODC-BY שמתיר שימוש מסחרי תמורת ייחוס. יחד עם זאת, הטקסטים עצמם מגיעים ממקורות שונים, וחלקם נושאים רישיונות שמחייבים שיתוף זהה כמו CC-BY-SA או תנאים ייחודיים. חובה לסנן את הרשומות לפי שדה הרישיון לפני אימון מוצר מסחרי.

האם יש בדאטהסט טקסטים בעברית?

לא. המאגר מוגדר וממוקד אך ורק בשפה הגרמנית. כל 41 המקורות שנאספו מייצגים טקסטים מגרמניה, מוסדות אירופיים וארכיונים בשפה זו בלבד.

איך נאסף החומר שנמצא בפנים?

החומר לוקט מ־41 מאגרי מידע קיימים, ספריות דיגיטליות, ארכיוני עיתונות, מסמכי פרלמנט, מאגרי פסיקה ואתרי אינטרנט כמו ויקיפדיה ויוטיוב. היוצרים ניקו כפילויות, החילו סינון איכות, וחישבו לכל מסמך מדדי שפה ואיכות סריקה.

במה הוא שונה מדאטהסטים רגילים של זחילת רשת?

בניגוד לקבצים עצומים של זחילת רשת גולמית שמכילים המון זבל ובעיות זכויות יוצרים, כאן יש הקפדה על מקורות ברישיונות פתוחים ידועים. בנוסף, הוא כולל מטא-דאטה עשיר של ציוני OCR ופרפלקסיטי שמאפשר לחתוך החוצה מידע באיכות נמוכה בקלות.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets עם השם coral-nlp/german-commons. המאגר כולו מורכב מ־468 קבצים, רובם קובצי Parquet המחולקים לפי תתי-מאגרים ומקורות, ויש בו גם קובץ bloom_filter.bin שתואם ל־DOLMA. אין צורך לבקש אישור גישה מיוחד כדי להוריד. אם אתם לא צריכים את כל 154 מיליארד הטוקנים, אפשר לטעון רק תחום ספציפי כמו cultural או לבחור split בודד כמו wikipedia. השדות שכדאי להסתכל עליהם בזמן הטעינה הם text, num_tokens וציוני האיכות של ה־OCR והפרפלקסיטי.

from datasets import load_dataset

ds = load_dataset("coral-nlp/german-commons")

הרישיון

האוסף והמטא-דאטה משוחררים ברישיון ODC-BY, שמאפשר שימוש מסחרי ושינויים כל עוד נותנים ייחוס מתאים. עם זאת, המסמכים עצמם מגיעים ממקורות שונים עם רישיונות מגוונים כמו CC0, CC-BY, CC-BY-SA ו־EUPL. חובה לבדוק את שדה ה־license בכל רשומה, במיוחד אם אתם מאמנים מודל מסחרי סגור ורוצים להימנע מרישיונות הדורשים שיתוף זהה.

הרישיון המלא ב־Hugging Face ↗