GPT
W

esdurmus/wiki_lingua

קוד פתוח

esdurmuscc-by-3.02022-03-02

המאגר מרכז מדריכים מפורטים ותקצירי פסקאות מתוך אתר wikiHow ב־18 שפות שונות. הוא מיועד בעיקר למי שרוצה לאמן או לבדוק מודלים של סיכום טקסט רב־לשוני מבוסס מקורות מקבילים.

  • 1,568הורדות בחודש
  • 55לייקים

מה זה

הנתונים מבוססים על מדריכי שלב־אחר־שלב שנאספו מאתר wikiHow. הרעיון המרכזי ביצירה שלו היה הצמדה בין שפות שונות על בסיס התמונות שמלוות כל שלב במדריך המקורי, וכך נוצר יישור מקבילי איכותי בין שפות בלי להסתמך על תרגום מכונה עיוור.

כל רשומה במאגר כוללת את כתובת המקור של המדריך, ומבנה נתונים שמחזיק את שמות הפרקים, הטקסט המלא של כל פרק ורשימת התקצירים התואמת שנכתבה בידי אדם. החלוקה במאגר נעשית לפי שפות, כאשר כל שפה מגיעה כחלק אימון נפרד. האנגלית היא החלק הגדול ביותר עם קרוב ל־58 אלף דוגמאות אימון, ולאחריה פורטוגזית, צרפתית וגרמנית, לצד שפות קטנות בהרבה כמו טורקית עם כ־1,500 דוגמאות בלבד.

מתאים ל

  • אימון מודלי סיכום

    אימון מודלים שמייצרים תקצירים קצרים ומדויקים מתוך פסקאות הדרכה ארוכות במספר שפות.

  • הערכת ביצועים רב־לשונית

    בדיקה והשוואה של יכולות מודל להבין מדריכים בשפה אחת ולסכם אותם בשפה אחרת.

  • מחקר על יישור מקבילי

    חקר ביצועים של מודלים על טקסטים מקבילים שחוברו יחד באמצעות עוגנים חזותיים.

איפה זה נופל

הבעיה המרכזית לישראלים היא פשוטה, אין פה עברית בכלל. בנוסף, הכרטיס סובל מחוסר תיעוד קיצוני, וכל הסעיפים שעוסקים בהטיות, במידע רגיש, בשיטות הסינון המדויקות ובמגבלות החברתיות ריקים לגמרי. התוכן מוגבל אך ורק לסגנון הכתיבה של מדריכי עשה־זאת־בעצמך, ולכן הוא לא מייצג טקסט חדשותי, שיחות או ספרות מקצועית. יש גם פער עצום בגדלים בין השפות, מה שהופך אימון שוויוני למורכב.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. למרות שהכרטיס מציין רישיון פתוח, הטקסט מפרט שהתוכן נלקח מ־wikiHow וכפוף לתנאי רישיון לא־מסחרי שמחייב שיתוף זהה. שימוש מסחרי עלול להפר את זכויות היוצרים של בעלי התוכן המקורי.

האם יש במאגר תמיכה בעברית?

לא. המאגר מכיל 18 שפות בלבד, ביניהן ערבית, אנגלית, ספרדית ורוסית, אך עברית אינה נכללת באף אחת מחלוקות הנתונים.

איך הצליחו להתאים בין תקצירים בשפות שונות?

החוקרים ניצלו את העובדה שבאתר המקור יש תמונות זהות שמלוות כל שלב במדריך בכל שפה. התמונות שימשו כעוגן משותף, וכך הם יצרו התאמה מדויקת בין הטקסטים והתקצירים המקבילים.

האם הנתונים מוכנים לשימוש מיידי?

כן, הקבצים שמורים בפורמט Parquet מסודר לפי שפות. עם זאת, צריך לעבד את המילון הפנימי שמכיל את רשימות הפרקים והתקצירים כדי להתאים אותם למבנה קלט רגיל של מודל שפה.

איך טוענים

המאגר מאורגן לפי תיקיות של שפות שונות ומכיל 21 קבצים בסך הכול, בפורמט Parquet. הטעינה מתבצעת ישירות דרך הספרייה הרגילה באמצעות המזהה, ללא צורך בהרשאת גישה מיוחדת או אישור מקדים. השדות המרכזיים שמעניינים אתכם הם השדות בתוך המילון הפנימי, שמפרידים בין הטקסט המלא לבין התקציר שלו לפי פרקים.

from datasets import load_dataset

ds = load_dataset("esdurmus/wiki_lingua")

הרישיון

המטא־דאטה מדווח על רישיון cc-by-3.0, אבל הטקסט עצמו מבהיר שהמקור מגיע מאתר wikiHow שפועל תחת רישיון cc-by-nc-sa-3.0. הסתירה הזו מסוכנת. הרישיון של המקור אוסר שימוש מסחרי ומחייב שיתוף זהה, ולכן אסור להשתמש בנתונים האלה כדי לאמן מודל למוצר מסחרי. יש לתת קרדיט מלא לאתר המקורי לפי ההנחיות שלהם.

הרישיון המלא ב־Hugging Face ↗