GPT
A

aozorabunko-clean

קוד פתוח

globis-universitycc-by-4.02023-06-26

המאגר מרכז ספרות יפנית בנחלת הכלל מתוך פרויקט Aozora Bunko אחרי סינון וניקוי תווים. מי שמאמן מודלים על יפנית מקבל כאן טקסט נקי מתגיות ומדריכי קריאה, מוכן לעבודה ישירה.

  • 1,069הורדות בחודש
  • 48לייקים

מה זה

הנתונים מבוססים על קטלוג הספרים של Aozora Bunko, אתר יפני שמרכז יצירות שפגו זכויות היוצרים שלהן. היוצרים הורידו את רשימת היצירות המלאה, סיננו החוצה כותרים שלא הוגדרו במפורש כנחלת הכלל, ושלפו את הטקסט המלא של כל ספר בקידוד UTF-8. כל רשומה כוללת את גוף הטקסט, הערות שוליים שהופרדו לשדה ייעודי, ומטא-דאטה עשיר שנלקח ישירות מהקטלוג המקורי.

תהליך הניקוי כלל הסרת כפילויות על בסיס מזהי יצירה ומזהי מחבר, וכן מחיקה של טקסטים זהים לחלוטין. מעבר לזה, הטקסט עבר סטנדרטיזציה שכללה מחיקת כותרות עליונות, המרת הערות משובצות לסוגריים רגילים, הסרת תגי רובי שהם מדריכי הגייה פונטיים, המרת תווים מיוחדים לתקן יוניקוד, והסרת סימוני עיצוב וקווים מפרידים.

מתאים ל

  • אימון מודלי שפה ביפנית

    מתאים לשלבי קדם אימון או כוונון עדין של מודלים שמיועדים להבנה ויצירה של ספרות יפנית.

  • סיווג טקסטים ומחקר ספרותי

    מאפשר לבנות מודלים לסיווג כותבים או סגנונות כתיבה היסטוריים באמצעות שדות המטא-דאטה המצורפים.

  • ניתוח בלשני היסטורי

    משמש כבסיס לחקר המעבר בין כתיב יפני מסורתי לכתיב מודרני על בסיס הטקסטים המסומנים.

איפה זה נופל

הטקסטים מגיעים כולם מנחלת הכלל היפנית, מה שאומר שמדובר ביצירות היסטוריות ישנות ולא בשפה מודרנית יומיומית או עכשווית. אם מאמנים על המאגר כמו שהוא בלי סינון, מקבלים תערובת של כתיב עתיק וכתיב מודרני, כשקרוב לשליש מהחומר אינו משתמש בשיטת הכתיב החדשה. בנוסף, אין כאן שום ייצוג לשפות אחרות חוץ מיפנית, ואין פילוח מובנה לחלוקת אימון ומבחן מעבר לפיצול הבסיסי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים שיימכרו בתשלום. החובה היחידה היא מתן קרדיט מתאים ליוצרי המאגר.

האם יש במאגר טקסטים בעברית או באנגלית?

לא. המאגר כולל אך ורק ספרות ביפנית שנאספה מפרויקט Aozora Bunko, ללא תרגומים או טקסטים בשפות נוספות.

במה הוא שונה מהורדה ישירה מ־Aozora Bunko?

הוא חוסך את עבודת הניקוי הסיזיפית. הטקסטים כבר עברו הסרה של תגי רובי, המרת תווים מיוחדים ליוניקוד, ניקוי עימוד והפרדה מסודרת בין גוף הטקסט להערות השוליים.

כמה רשומות מתאימות לשימוש בשפה מודרנית?

מתוך 16,951 יצירות במאגר, סינון לפי כתיב מודרני מותיר 10,246 יצירות. שאר הטקסטים משתמשים בכתיב יפני מסורתי וישן.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets עם השם globis-university/aozorabunko-clean, בלי צורך באישור גישה מראש. הקובץ המרכזי שמור כ־jsonl דחוס ב־gzip. המאגר מכיל פיצול יחיד של train עם 16,951 רשומות, וכולל שלושה שדות בלבד: text, footnote ו־meta. אם רוצים לעבוד רק עם כתיב יפני מודרני, מפעילים סינון פשוט על השדה המתאים בתוך meta, מה שמשאיר 10,246 רשומות רלוונטיות.

from datasets import load_dataset

ds = load_dataset("globis-university/aozorabunko-clean")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי שנותנים קרדיט הולם ליוצרים ומציינים אם נעשו שינויים. אין דרישה לשתף תוצרי אימון או מודלים תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗