GPT
N

naver-news-summarization-ko

קוד פתוח

daekeun-mlapache-2.02022-08-01

  • korean
  • news
  • abstractive-summarization

מאגר של 27,400 זוגות כתבה ותקציר בקוריאנית מפורטל החדשות Naver. הוא נותן נקודת זינוק פשוטה לאימון מודלים של סיכום טקסט, אבל מוגבל מאוד בתחום ובזמן.

  • 1,437הורדות בחודש
  • 63לייקים

מה זה

הנתונים כוללים חדשות שנאספו ישירות מאתר Naver News במהלך עשרה ימים בלבד, בין 1 ל־10 ביולי 2022. כל שורה מכילה את תאריך הפרסום, קטגוריית הכתבה, שם גוף התקשורת, כותרת, גוף הטקסט המלא, קישור למקור ותקציר הייחוס. התקצירים מציגים יחס דחיסה ממוצע של פי 6.03 ביחס לאורך המקור בתווים.

התוכן מחולק באופן מובהק לשני נושאים בלבד: כלכלה מהווה 77 אחוז מהרשומות, וטכנולוגיה ומדע מכסים את 23 האחוזים הנותרים. החלוקה הפנימית מציעה 22,194 רשומות בקובץ האימון, 2,740 בקובץ הבחינה ועוד 2,466 רשומות בקובץ האימות.

מתאים ל

  • אימון מודלים בקוריאנית

    כוונון עדין של מודלי שפה פתוחים על משימות סיכום של טקסטים עיתונאיים בכלכלה וטכנולוגיה.

  • סדנאות והדרכות NLP

    תרגול תהליכי עיבוד שפה טבעית על מאגר טקסט מוכן ומחולק מראש ללא צורך בהכנה מורכבת.

  • מחקר כיווץ מידע

    ניתוח יחסי דחיסה והשוואת גישות סיכום מחלצות מול גישות יוצרות על תוכן עיתונאי מוגדר.

איפה זה נופל

יש פה בעיית דליפה מובנית שחייבים להכיר. החלוקה לפיצולים נעשתה אקראית ללא הסרת כפילויות, ומאחר שסוכנויות ידיעות בקוריאה מפיצות את אותן ידיעות לכמה גופי תקשורת, נמדדה חפיפת כותרות של 16.8 אחוז בין קובץ הבחינה לקובץ האימון. המשמעות היא שציוני ההערכה שלכם עלולים לצאת גבוהים ומטעים, ויש לסנן כפילויות לפני שמודדים דיוק.

המאגר כולו נאסף לאורך עשרה ימים בודדים, כך שאוצר המילים והנושאים משקפים רק את מה שקרה ביולי 2022 בתחומי הכלכלה והטכנולוגיה. בנוסף, התקצירים נאספו מהדפים כמו שהם, ללא תהליך בקרת איכות או הנחיות עריכה אחידות, והסגנון משתנה בין כותבים שונים.

שאלות
נפוצות

האם המאגר מתאים למוצר מסחרי?

הרישיון של המאגר הוא Apache-2.0, אבל הטקסטים עצמם הם כתבות מוגנות בזכויות יוצרים של גופי תקשורת. המפרסם מציין שהמאגר מיועד למחקר ולתרגול, וממליץ לבדוק היטב את המצב המשפטי לפני הפצה מסחרית של התכנים.

האם יש במאגר טקסטים בעברית?

לא. כל 27,400 הרשומות כתובות בקוריאנית בלבד ונאספו מאתר החדשות הקוריאני Naver.

איך נאספו הנתונים והתקצירים?

הנתונים נאספו בסריקת רשת מכתבות שעלו ב־Naver News בין 1 ל־10 ביולי 2022. התקצירים הם שדות תקציר מוכנים מתוך עמודי החדשות עצמם, ולא תמציות שנכתבו בידי בודקים במסגרת ניסוי מבוקר.

מדוע אי אפשר להסתמך על קובץ הבחינה כמו שהוא?

בגלל ציטוט כתבות רוחבי ברשתות החדשות הקוריאניות, קיימת חפיפה של 16.8 אחוז בכותרות בין קובץ האימון לקובץ הבחינה. אם תמדדו ביצועים ישירות על הפיצול הקיים, תקבלו תוצאות אופטימיות מדי שאינן משקפות הכללה אמיתית.

איך טוענים

טוענים את המאגר ישירות בספריית datasets של Hugging Face ללא צורך באישור גישה מוקדם או במפתחות מיוחדים. הקבצים שמורים בפורמט CSV סטנדרטי המחולק לשלושת הפיצולים. השדות הקריטיים לתהליך העבודה הם document שמשמש כקלט המודל, ו־summary שמתפקד כפלט הרצוי. שאר העמודות מספקות הקשר ומטא-דאטה שיכולים לעזור בסינון מוקדם.

from datasets import load_dataset

ds = load_dataset("daekeun-ml/naver-news-summarization-ko")

הרישיון

האוסף עצמו מופץ ברישיון Apache-2.0, שמאפשר שימוש חופשי ושינוי קוד, אך זכויות היוצרים על גוף הכתבות שייכות למוציאים לאור המקוריים. הקישורים למקור נשמרו ברשומות בדיוק לשם כך. מי שמתכנן להפיץ את הטקסטים בצורה מסחרית או לבנות מוצר מסחרי צריך לבדוק קודם את תנאי השימוש מול אתרי המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗