GPT
K

KakologArchives

קוד פתוח

KakologArchivesmit2023-05-12

ארכיון ענק של תגובות גולשים בזמן אמת לשידורי טלוויזיה יפניים מ־2009 ועד היום. הוא מתאים למי שחוקר סלנג יפני חי, תגובות לשידורים חיים ואינטראקציות רשת שלא קיימות בטקסטים רשמיים.

  • 2,509,960הורדות בחודש
  • 83לייקים

מה זה

המאגר מרכז תגובות שנאספו משירות השידור החי Niconico Jikkyo היפני, כולל ערוצי טלוויזיה ורדיו. המידע התחיל מאיסוף ידני של קהילת DTV מאתר 5ch בעקבות סגירת המערכת הישנה ב־2020. בהמשך נוספו נתונים מהמערכת החדשה, ומיוני 2024 המאגר מושך נתונים כל חמש דקות משרת התגובות החלופי NX-Jikkyo. אין כאן סינון של תוכן פוגעני או ניקוי שפה.

כל רשומה מייצגת תגובת צופה בודדת. השדות כוללים את מזהה השרשור, מספר התגובה, חותמת זמן בשניות ובמיקרו-שניות, מיקום התגובה בציר הזמן במאיות שנייה, ומזהה משתמש. יש גם סימון האם המשתמש אנונימי או מנוי פרימיום, פקודות עיצוב התגובה כמו צבע ומיקום, ותוכן ההודעה עצמה, שיכול להכיל ציורי אסקי או טקסט מרובה שורות. המאגר מחולק לשני חלקים: מדגם בשם sample הכולל תגובות מערוץ TOKYO MX משנת 2022, והחלק המלא all שמכיל את כל הערוצים והשנים.

מתאים ל

  • ניתוח סנטימנט בשידור חי

    אימון מודלים לסיווג תגובות ורגשות קהל בזמן אמת לתוכניות טלוויזיה יפניות לפי חותמות זמן.

  • זיהוי סלנג וקיצורי רשת

    בניית מילונים וזיהוי ביטויים עכשוויים ביפנית שאינם מופיעים בטקסטים מסורתיים או חדשותיים.

  • מחקר סוציולוגי והיסטורי

    מעקב אחר תגובות הציבור היפני לאירועים חדשותיים ותרבותיים לאורך חמש עשרה שנים.

איפה זה נופל

המאגר כולו ביפנית בלבד, בלי שום מילה בעברית או ייצוג לשפות אחרות. הנתונים מגיעים מצופים שהגיבו לטלוויזיה היפנית ברשת, כך שהשפה מלאה בסלנג מקומי, קיצורים ייחודיים לקהילה, בדיחות פנימיות ואמנות אסקי שעלולה לשבור מודלים רגילים. חלק מהמשתמשים מוגדרים כאנונימיים והמזהים שלהם עורבבו מדי שבוע, כך שקשה לעקוב אחרי פרופיל עקבי לאורך זמן. הטקסט לא עבר סינון, מה שאומר שהוא עלול להכיל תוכן פוגעני או שפה בוטה שמחייבים ניקוי יסודי לפני אימון.

שאלות
נפוצות

האם המאגר מתאים לפרויקטים בעברית?

לא. כל התוכן נאסף מצופים של שידורי טלוויזיה יפניים והוא כתוב כולו ביפנית בלבד. אין בו מילים בעברית והוא לא יעזור לאימון מודלים לשפה המקומית.

האם מותר להשתמש במידע למוצר מסחרי?

המאגר עצמו מוגדר תחת רישיון MIT שמאפשר שימוש מסחרי ללא מגבלות שיתוף. יחד עם זאת, התוכן מורכב מתגובות של מיליוני גולשים שנאספו מהרשת, כך שיש לוודא שהשימוש בטקסט הגולמי עומד בכללי השימוש ההוגן הרלוונטיים.

כמה שטח אחסון צריך כדי להוריד אותו?

אם בוחרים בפיצול המלא מדובר ביותר מ־190 גיגה-בייט של קבצים. לניסויים ראשוניים עדיף להשתמש בפיצול המדגם ששוקל כגיגה-בייט אחד, או להגדיר סינון לשנה או לערוץ מסוים.

איך המידע נאסף?

הארכיון מורכב מעבודת גיבוי קהילתית שהצילה 11 שנות פעילות לפני סגירת השירות המקורי ב־2020. אליהן נוספו נתונים מהפלטפורמה המחודשת ואיסוף שוטף כל חמש דקות משרת חלופי שפועל כיום.

איך טוענים

טוענים את המאגר דרך ספריית datasets בפייתון באמצעות סקריפט הטעינה המובנה. לא צריך לבקש הרשאת גישה מיוחדת, אבל צריך להיזהר עם הנפח: הפיצול המלא שוקל יותר מ־190 גיגה-בייט וכולל 98,922 קבצים בפורמט nicojk. דגימת הבדיקה שוקלת כגיגה-בייט אחד. סקריפט הטעינה מאפשר לסנן מראש לפי מזהה ערוץ, שנה ומספר קבצים מרבי, וכדאי להשתמש בזה כדי לא להוריד את כל המאגר בטעות. השדות המרכזיים לניתוח הם content לטקסט ו־date לתזמון.

from datasets import load_dataset

ds = load_dataset("KakologArchives/KakologArchives")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי לגמרי, כולל שימוש מסחרי, שינוי הקוד ואימון מודלים, בלי דרישה לשתף את התוצרים באותו רישיון. החובה היחידה היא לשמור על הצהרת זכויות היוצרים והרישיון המקורי. עם זאת, התוכן עצמו הוא תגובות שנאספו ממשתמשים ללא אישור ישיר מהם, כך שמשפטית כדאי לקחת בחשבון את מעמד זכויות היוצרים של הטקסטים עצמם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗