GPT
W

wikisource

קוד פתוח

wikimediacc-by-sa-3.0,gfdl2022-03-02

המאגר מרכז טקסטים היסטוריים וספרותיים מפרויקט ויקיטקסט בעשרות שפות. מי שבונה מודל שפה ומחפש מקורות כתובים חופשיים מפגיעת זכויות יוצרים ימצא כאן חומר גלם נקי.

  • 5,189הורדות בחודש
  • 84לייקים

מה זה

הנתונים מגיעים ישירות מדפי ויקיטקסט בתאריך 20231201 ומכילים טקסטים מלאים של יצירות היסטוריות, תעודות ותרגומים שפגו עליהם זכויות היוצרים. כל רשומה כוללת ארבעה שדות בלבד: מזהה ייחודי, כתובת המקור, כותרת היצירה ותוכן הטקסט עצמו.

המאגר מחולק לפי שפות בתצורות נפרדות, כולל פיצולים ברורים לכל שפה. ברוסית יש 372768 דוגמאות אימון, באנגלית 208279, ובעברית 107248 דוגמאות. שפות מסוימות מכילות נפח זעיר, כמו בנגלית שכוללת 5 דוגמאות בלבד. כרטיס המאגר לא מפרט תהליכי סינון, ניקוי עיצוב או הסרת תגיות ויקי מעבר לחילוץ הבסיסי.

מתאים ל

  • אימון מודלי שפה היסטוריים

    לימוד מבנים תחביריים עתיקים ואוצר מילים של עברית קלאסית.

  • משימות השלמת מילים

    ביצוע fill-mask על טקסטים דתיים, ספרותיים ומסמכים רשמיים.

  • מחקר בלשני כמותי

    ניתוח סטטיסטי והשוואת סגנונות כתיבה על פני תקופות שונות.

איפה זה נופל

הטקסטים מייצגים כתיבה היסטורית, ארכאית ומשפטית, ולא שפה יומיומית או מודרנית. החלוקה בין השפות אינה מאוזנת, כאשר חלקן כוללות מאות אלפי רשומות ואחרות עשרות בודדות. כרטיס המאגר לא מדווח על סינון שגיאות סריקה או הסרת רעשי ocr, ולכן צריך לבדוק את איכות הטקסט לפני שמזינים אותו לאימון.

שאלות
נפוצות

האם יש במאגר עברית?

כן, קיימת תצורה בשם 20231201.he שמכילה 107248 דוגמאות אימון. גודל ההורדה של החלק העברי הוא 519792862 בתים והוא תופס 1166312812 בתים בזיכרון.

האם מותר להשתמש בנתונים למטרות מסחריות?

הרישיונות המדווחים הם cc-by-sa-3.0 ו־gfdl, שמתירים שימוש מסחרי בכפוף לייחוס מתאים. עם זאת, תנאי שיתוף זהה מעלים שאלות משפטיות לגבי שחרור מודלים שנגזרו מהאימון.

אילו שדות קיימים בכל רשומה?

כל דוגמה במאגר מורכבת מארבעה שדות טקסט בלבד: id, url, title ו־text. אין תיוגים מיוחדים, מטא-דאטה על תאריכי חיבור היצירות או חלוקה לנושאים.

איך מחולק הדאטהסט בין קבצים?

המאגר כולל 115 קבצים בפורמט parquet, המחולקים לפי שפות ותאריך הדגימה. כל שפה מוגדרת כתצורה עצמאית עם פיצול אימון יחיד.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה הרגילה באמצעות ציון שם המאגר והשפה הרצויה, למשל 20231201.he לעברית. אין צורך באישור גישה או ברישום מקדים. הקבצים שמורים בפורמט parquet מפוצל, כאשר בעברית נפח ההורדה עומד על 519792862 בתים והנפח הפרוס תופס 1166312812 בתים. השדות העיקריים לעבודה הם title ו־text בלבד.

from datasets import load_dataset

ds = load_dataset("wikimedia/wikisource")

הרישיון

המאגר מופץ ברישיונות כפולים של cc-by-sa-3.0 ו־gfdl. מותר להשתמש בטקסטים לצרכים מסחריים, אך חלה חובת ייחוס ברורה ליוצרים. סעיף השיתוף הזהה מחייב לבדוק היטב ייעוץ משפטי לגבי מעמדם של משקולות מודל שאומן על החומרים האלה, מחשש לדרישה להפיץ את התוצרים באותו רישיון בדיוק.

הרישיון המלא ב־Hugging Face ↗