GPT
W

wiki_lingua

קוד פתוח

GEMcc-by-nc-sa-3.02022-03-02

מאגר מדריכים מעשיים מרובי שפות שנועד לאימון והערכה של מודלי סיכום תוכן. הוא מאפשר לבחון יכולות תמצות ישירות משפת מקור אחת לשפת יעד אחרת.

  • 9,323הורדות בחודש
  • 50לייקים

מה זה

הנתונים נאספו כולם מאתר wikiHow, מתוך מדריכים שנכתבו ונבדקו בידי בני אדם ב־19 קטגוריות שונות, כמו בריאות, סגנון אישי, נסיעות וחינוך. הרשומות מורכבות מטקסט המדריך המלא לצד סיכום תמציתי. החוקרים הצליבו את הגרסאות המקבילות בין השפות השונות באמצעות התמונות שליוו כל שלב במדריך המקורי, כדי ליצור התאמה מדויקת בין שפות מקור ויעד.

הכרטיס מדווח שהטקסטים לא עברו סינון או תיקוף נוסף לאחר האיסוף. החלוקה נעשתה לרכבות אימון, פיתוח ומבחן, כאשר ישנה גם גרסה מדגמית של סט המבחן. כדי למנוע דליפת מידע בין הסטים, אותם מסמכים שובצו בדיוק באותו חלק בכל השפות הזמינות.

מתאים ל

  • אימון מודלי סיכום חוצי שפות

    מאפשר ללמד מודלים לתמצת מדריך משפת מקור ישירות לשפת יעד אחרת בלי צורך בתרגום מכונה מקדים.

  • בנצ'מרק למשימות תמצות רב לשוני

    הערכת ביצועי מודלי שפה על טקסטים הדרכתיים בעזרת מדדי ROUGE על גבי 18 שפות נתמכות.

  • מחקר על תיאום טקסטים מתמונות

    בחינת שיטות להצלבת מידע בין שפות המבוססות על עוגנים חזותיים זהים בשלבי ההדרכה.

איפה זה נופל

אם אתם בונים על עברית, אין כאן מה לחפש. המאגר מכיל 18 שפות בלבד ורובן הגדול שפות מערביות או אסיאתיות נפוצות. הטקסטים לא סוננו, כך שכל טעות, מידע שגוי או הטיות חברתיות שהיו ב־wikiHow המקורי נכנסו פנימה ישירות. בנוסף, מדובר רק בז'אנר ספציפי של מדריכי עשה זאת בעצמך, ולכן מודל שיאומן עליו יתקשה להתמודד עם חדשות, מאמרים אקדמיים או מסמכים משפטיים. החוקרים לא הציגו תוכנית תחזוקה עתידית לעדכון הנתונים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון המדווח הוא cc-by-nc-sa-3.0 והוא אוסר במפורש שימוש מסחרי. המגבלה חלה גם על הנתונים עצמם וגם על המודלים שתאמנו עליהם. אם אתם עובדים בסטארטאפ שמתכנן למכור את השירות, חפשו מקור מידע אחר.

האם יש בדאטהסט תמיכה בעברית?

לא, עברית אינה נכללת ברשימת 18 השפות של המאגר. השפות הזמינות כוללות בין היתר אנגלית, ערבית, ספרדית, גרמנית, רוסית ותאילנדית. לצורך עבודה על עברית תצטרכו להסתמך על מקורות אחרים.

איך בוצעה התאמת הסיכומים בין השפות השונות?

החוקרים אספו מדריכים מגרסאות שונות של אתר wikiHow והצליבו ביניהם לפי התמונות שליוו כל שלב. התמונות שימשו כעוגן שהבטיח שהתוכן המתורגם עוסק באותו נושא בדיוק. כך נוצרו צמדים של מסמך בשפה אחת וסיכום בשפה אחרת.

במה המאגר הזה שונה ממאגרי סיכום כמו XSum או MLSum?

מאגרים כמו XSum ו־MLSum מבוססים על כתבות חדשותיות במספר שפות מצומצם מאוד. המאגר הנוכחי מתמקד במדריכים מעשיים, מה שמספק סגנון כתיבה שונה לחלוטין. בנוסף הוא מכסה 18 שפות שונות ומציע התאמה ישירה בין שפות שונות.

איך טוענים

טוענים את המאגר ישירות בספריית datasets של Hugging Face באמצעות המזהה GEM/wiki_lingua. אין צורך בבקשת אישור גישה מיוחדת, הכל פתוח להורדה מיידית. במסגרת ההתאמה ל־GEM נבנו טוענים ייעודיים למשימות חד-לשוניות ולמשימות חוצות שפות. השדות המרכזיים שמעניינים אתכם בקובץ הם source עבור המסמך המלא, target עבור הסיכום, לצד gem_id ושדות השפה source_language ו־target_language.

from datasets import load_dataset

ds = load_dataset("GEM/wiki_lingua")

הרישיון

הרישיון הוא cc-by-nc-sa-3.0, וזה חוסם לחלוטין כל שימוש מסחרי. מותר להשתמש בנתונים אך ורק למחקר או לפרויקטים אישיים, תוך מתן ייחוס מתאים ליוצרים. סעיף השיתוף הזהה מחייב שכל נגזרת או תוצר שתפרסמו יופצו תחת אותו רישיון מגביל בדיוק. מודל שתאמנו על הדאטהסט הזה לא יוכל להיכנס למוצר מסחרי של החברה שלכם.

הרישיון המלא ב־Hugging Face ↗