GPT
W

wikipedia-cn-20230720-filtered

קוד פתוח

0xDingcc-by-sa-3.02023-07-23

  • wikipedia

המאגר מרכז ערכים מוויקיפדיה הסינית שעברו סינון קפדני של תוכן שנוי במחלוקת וטקסטים באיכות נמוכה. הוא מיועד למי שצריך טקסט נקי בסינית יבשתית לאימון מודלים של יצירת שפה.

  • 2,014הורדות בחודש
  • 173לייקים

מה זה

הנתונים מבוססים על דאמפ של ויקיפדיה בסינית מיום 20 ביולי 2023. המפרסם השאיר בפנים רק ערכים שנחשבים בעיניו כאיכותיים, סך הכל 254,547 רשומות, או 254,574 לפי הפסקה האנגלית שמתארת את אותו המאגר בדיוק.

תהליך הניקוי כלל העפה של דפים טכניים כמו תבניות, קטגוריות, טיוטות ופורטלים. מעבר לזה, הופעלו חוקים היוריסטיים ומודל שפה פנימי כדי למחוק ערכים קצרים או דלים, יחד עם הסרה מכוונת של ערכים בעלי אופי רגיש או שנוי במחלוקת מבחינה פוליטית וחברתית.

הטקסט שנשאר עבר התאמה לסינית מפושטת ולסגנון הניסוח המקובל בסין היבשתית. זה אומר שהוחלפו מונחים וביטויים מסורתיים כך שיתאימו לטרמינולוגיה הרשמית שם, מה שהופך את כל התוכן למוכוון ניב אחד בלבד.

מתאים ל

  • אימון מקדים בסינית

    משמש כחומר גלם טקסטואלי לאימון מודלי שפה עבור השוק של סין היבשתית.

  • התאמת שפה לסינית מפושטת

    אימון מודלים קטנים ללמידת המינוח והדקדוק הנהוגים בסין במקום טייוואן או הונג קונג.

  • משימות יצירת טקסט

    בניית יכולות השלמת משפטים וכתיבה רציפה בסינית על בסיס ערכים אנציקלופדיים מסוננים.

איפה זה נופל

זה לא תחליף לדאמפ ויקיפדיה ניטרלי או מלא. היוצר מצהיר במפורש שהוא השתמש במודל פרטי כדי לסנן תוכן רגיש ושנוי במחלוקת, בלי לפרט מה היו הקריטריונים המדויקים, מה שמכניס צנזורה והטיה מובהקת לכיוון הנרטיב של סין היבשתית. בנוסף, אין פה בכלל עברית או אנגלית, הנתונים קפואים ביולי 2023, והסינון העיף חלקים גדולים מאוד מהאנציקלופדיה המקורית.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מכיל טקסט בסינית בלבד, שעבר התאמה מלאה לניב ולמינוח של סין היבשתית.

מותר להשתמש בו לפרויקט מסחרי?

הרישיון cc-by-sa-3.0 לא אוסר על שימוש מסחרי, אבל מחייב ייחוס ושיתוף של נגזרות תחת רישיון זהה. אם אתם בונים מודל קנייני סגור, זה עלול ליצור בעיה משפטית מול תנאי השיתוף.

מה ההבדל בין המאגר הזה לדאמפ ויקיפדיה הרגיל בסינית?

דאמפ רגיל כולל את כל התוכן ללא אפליה, כולל ערכים פוליטיים רגישים וניבים מחוץ לסין היבשתית. כאן נמחקו דפים שנויים במחלוקת באמצעות מודל ייעודי, ונשארו רק כרבע מיליון ערכים נקיים ומותאמים לסגנון המקומי.

איך טוענים

המאגר פתוח לציבור ואין צורך בבקשת גישה מיוחדת. הנתונים עצמם שמורים בקובץ json יחיד בשם wikipedia-cn-20230720-filtered.json, לצד קובץ התיעוד, כך שאפשר למשוך אותו ישירות עם ספריית datasets הרגילה או לקרוא אותו ידנית בקוד שלכם. סדר הגודל יושב בין מאה אלף למיליון רשומות, מה שאומר שהוא יחסית קל לטעינה ולעיבוד ראשוני בזיכרון.

from datasets import load_dataset

ds = load_dataset("0xDing/wikipedia-cn-20230720-filtered")

הרישיון

המאגר משוחרר ברישיון cc-by-sa-3.0. מותר להשתמש בו לצרכים מסחריים, אבל חובה לתת קרדיט ולהפיץ כל תוצר נגזר או שינוי של המאגר תחת אותו רישיון בדיוק. אם אתם מאמנים עליו מודל, סעיף השיתוף הזהה עלול לסבך את שחרור המשקולות או המוצר שלכם מבחינה משפטית.

הרישיון המלא ב־Hugging Face ↗