GPT
B

banned-historical-archives

קוד פתוח

banned-historical-archivesרישיון לא דווח2023-12-17

מאגר ענק של מסמכים, עיתונים ותמונות מההיסטוריה הפוליטית הסינית שנאסרו לפרסום או צונזרו. המקור מיועד למי שבונה מודלים היסטוריים או חוקר טקסטים סיניים מחוץ לנרטיב הרשמי.

  • 1,577,362הורדות בחודש
  • 76לייקים

מה זה

המאגר מרכז קבצים גולמיים לצד נתוני תצורה של אתר ארכיון היסטורי. בפנים תמצאו מעל 86,000 קבצים הכוללים טקסטים מנותחים, סקריפטים לפענוח אופטי של תווים, קובצי הגדרות בפורמט TypeScript כמו כתבי מאו דזה דונג, ותיקיות ייעודיות לחומרים שטרם עברו עיבוד. הנתונים מתעדכנים ישירות מפעילות גיטהאב של המיזם.

המבנה מחולק לחומרים שכבר הועלו לאתר ולקבצים שממתינים לעיבוד תחת תיקיית המשימות. חלקים נרחבים מהעיתונות ההיסטורית, דוגמת יומון העם, עיתוני הונג קונג ופסקי דין, מנוהלים במאגרים נפרדים שמקושרים מכאן. מדובר באיסוף מבוזר של מקורות ראשוניים, סריקות ועיבודים שנשלחים על ידי תורמים שונים ברשת.

מתאים ל

  • מחקר טקסטואלי היסטורי

    ניתוח שינויים בעיתונות ובפרסומים מפלגתיים לאורך שנות שלטונו של מאו.

  • אימון מודלי שפה בסינית

    העשרת אוצר המילים וסגנון הכתיבה הפוליטי מתוך מקורות סיניים מודרניים שנאסרו להפצה.

  • בדיקת מערכות זיהוי תווים

    הערכת דיוק של מודלי תמלול על סריקות עיתונים ישנים וטפסים היסטוריים.

איפה זה נופל

זה לא מאגר מוכן לאימון ישיר. הנתונים מכילים בליל של סקריפטים, קובצי תצורה וטקסט גולמי ללא חלוקה מובנית לסט אימון ובדיקה. המקורות כולם בסינית ומתמקדים בזירה הפוליטית המקומית, כך שאין כאן שום מידע בעברית או באנגלית. חלק מהחומרים עברו פענוח אופטי אוטומטי שעלול להכיל שגיאות קריאה, ואיכות הטקסט תלויה בסריקות המקוריות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. יוצרי המאגר לא הגדירו רישיון שימוש, ולכן אין היתר חוקי לשימוש מסחרי במידע או בפלטים שנגזרים ממנו ישירות.

כמה מקום בדיסק צריך בשביל להוריד הכל?

המאגר כולל עשרות אלפי קבצים, והיוצרים מציינים שכלל הנתונים בפרויקט תופסים מעל 4TB. אם מושכים את המידע דרך גיט, חובה להגביל את עומק המשיכה כדי להימנע מהיסטוריית גרסאות כבדה.

האם יש במאגר נתונים בעברית?

אין שום תוכן בעברית. כל המסמכים, הסריקות והעיתונים הם בסינית ועוסקים בהיסטוריה ומשפט בסין.

איך החומרים נאספו וסוננו?

האיסוף מתבצע על ידי תורמים ברשת שמעלים קבצים ידנית או דרך מערכות אוטומטיות בגיטהאב. חלק מהעיתונים נבררו ידנית לפי חשיבות, בעוד חומרים אחרים נשמרים כסריקות גולמיות ללא עיבוד מקדים.

איך טוענים

טעינה רגילה באמצעות ספריית הנתונים של הגינג פייס פחות מתאימה כאן בגלל המבנה החריג. המאגר מכיל 86,142 קבצים בעץ תיקיות שכולל קוד, הגדרות וטקסטים גולמיים. הגישה חופשית ואין צורך באישור, אבל סך כל החומרים בפרויקט חוצה את רף ה־4TB. מומלץ למשוך את הנתונים ישירות באמצעות גיט עם עומק היסטוריה מינימלי כדי לחסוך מקום וזמן הורדה.

from datasets import load_dataset

ds = load_dataset("banned-historical-archives/banned-historical-archives")

הרישיון

המאגר פורסם ללא רישיון כלל. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין הרשאה מפורשת להעתיק, להפיץ או לאמן מודלים מסחריים על החומרים. שילוב הנתונים במוצר מסחרי חושף אתכם לסיכון משפטי ברור.

הרישיון המלא ב־Hugging Face ↗