GPT
W

wiki40b

קוד פתוח

googleרישיון לא דווח2022-03-02

המאגר מרכז ערכי ויקיפדיה מעובדים ומנוקים לאימון מודלי שפה בכמה שפות. מי שפונה אליו מחפש טקסט אנציקלופדי מסודר שמחולק מראש לסטים של אימון ובדיקה.

  • 12,908הורדות בחודש
  • 37לייקים

מה זה

גוגל העלתה כאן גרסה מעובדת של ערכי ויקיפדיה בפורמט פרקט, שמחולקת מראש לפי שפות וכוללת פיצולים מוגדרים של אימון, בדיקה ואימות. לפי מבנה הקבצים שפורסמו במרץ 2022, המאגר מכיל חלוקה לתיקיות שונות לפי קידומת שפה, כמו ערבית ובולגרית, כשבכל תיקייה שמורים קובצי אימון, ולידציה ובדיקה נפרדים.

כרטיס הדאטהסט הרשמי בעמוד ריק למדי ולא כולל פירוט לגבי תהליך הניקוי, אופן הסינון של הרשומות או המבנה הפנימי המדויק של הטקסטים בכל שורה. כל מה שנשאר להסתמך עליו בעמוד הוא סידור הקבצים הגולמי והעובדה שמדובר בעיבוד של תכנים אנציקלופדיים.

מתאים ל

  • אימון מקדים למודלי שפה

    הזנת טקסט אנציקלופדי רציף ונקי יחסית למודלי שפה בשפות הנתמכות במאגר.

  • הערכת ביצועי מודלים

    בדיקת איכות של מודל קיים על סטים מוכנים של מבחן ואימות מתוך ויקיפדיה.

  • מחקר על דאטה רב לשוני

    ניתוח השוואתי של טקסטים מקבילים בשפות שונות שמחולקות לקובצי פרקט ייעודיים.

איפה זה נופל

הבעיה המרכזית היא חוסר תיעוד מוחלט. גוגל השאירה את רוב הסעיפים בכרטיס ריקים, כך שאין שום מידע רשמי על תאריך החיתוך של הנתונים מוויקיפדיה, הטיות ידועות או מזהים אישיים שנשארו בפנים. בנוסף, רשימת השפות הראשית מציגה אנגלית בלבד, בזמן שמבנה הקבצים מציג תיקיות כמו ערבית ובולגרית, ואין תיעוד ברור לקיום עברית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא מומלץ כרגע, כי לא דווח שום רישיון בעמוד הדאטהסט. בלי רישיון מסודר אין הגנה משפטית לשימוש בתוכן, בטח כשמדובר במוצר שמייצר הכנסות.

האם המאגר כולל טקסטים בעברית?

לפי המידע בעמוד לא מופיעה עברית. השפה המוצהרת בכרטיס היא אנגלית, והדוגמאות לקבצים מראות שפות כמו ערבית ובולגרית, בלי זכר לקבצים עם קידומת מקומית.

מאיפה הנתונים נאספו ואיך הם סוננו?

הטקסטים מגיעים מוויקיפדיה, אבל גוגל השאירה את סעיפי הסינון בכרטיס ריקים לגמרי. אי אפשר לדעת מאיזה תאריך הנתונים או אילו חיתוכים וניקויים בוצעו עליהם בפועל.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטס הרגילה בפייתון בעזרת המזהה של גוגל, בלי צורך בבקשת גישה מיוחדת או אישור מראש. המאגר מכיל 265 קבצים בפורמט פרקט שמחולקים לפי שפות, לכן מומלץ לציין את השפה המבוקשת ולא למשוך את כל התיקיות בבת אחת.

from datasets import load_dataset

ds = load_dataset("google/wiki40b")

הרישיון

בעמוד המאגר לא דווח שום רישיון. משפטית, היעדר רישיון מוגדר יוצר בעיה קשה לכל פרויקט מסחרי, כי אין אישור כתוב להשתמש בדאטה, להפיץ אותו או לפרסם מודלים שאומנו עליו. מי שבונה משהו למטרות רווח לוקח כאן סיכון מול זכויות היוצרים של התוכן המקורי.

הרישיון המלא ב־Hugging Face ↗