GPT
P

pile

קוד פתוח

EleutherAIother2022-03-02

מאגר טקסט עצום באנגלית שמחבר מקורות מגוונים, מקוד תוכנה ועד מאמרים רפואיים. הוא מתאים למי שרוצה לאמן מודלי שפה גדולים על טקסט עשיר ולא רק על דפי אינטרנט כלליים.

  • 9,209הורדות בחודש
  • 503לייקים

מה זה

הנתונים מחולקים ל־22 תת-מאגרים שונים ומאוגדים יחד לנפח של 825 GiB. המקורות כוללים טקסטים מאתרי אינטרנט כמו Hacker News, קוד מקור מ־GitHub, מאגרים משפטיים של Free Law, תקצירי מחקר ומאמרים מ־PubMed ו־PubMed Central, רישומי פטנטים מ־USPTO, תכתובות מייל של Enron, יומני צ'אט מ־IRC של אובונטו, ופרוטוקולים מפרלמנט האיחוד האירופי.

כל רשומה במאגר מורכבת מטקסט גולמי ומאובייקט מטא-דאטה שמשתנה לפי המקור. בקוד מ־GitHub תמצאו שם מאגר, כוכבים ושפת תכנות. בטקסטים משפטיים תמצאו מזהה תיק ושנת יצירה, וביומני צ'אט תמצאו ערוץ ותאריך. המאגר הכולל מפוצל לשלושה חלקים קבועים: אימון, ולידציה ובדיקה.

מתאים ל

  • אימון מקדים למודלי שפה

    בניית מודלי שפה גדולים מאפס על גבי טקסט מגוון שכולל ספרות מדעית, קוד ומסמכים רשמיים.

  • הערכת ביצועים במשימות שפה

    בדיקת יכולות של מודלים קיימים במשימות יצירת טקסט והשלמת מילים חסרות על פלחי הבדיקה.

  • אימון מודלים להבנת קוד

    חילוץ תת-המאגר של GitHub כדי לאמן מודלים ייעודיים להשלמת קוד ותיעוד תוכנה.

איפה זה נופל

הטקסטים במאגר מוגדרים באנגלית בלבד, כך שהוא לא יעזור למי שמחפש עברית. תת-מאגרים מסוימים מכילים שפות אחרות במקור כמו פרוטוקולים מאירופה, אבל המיקוד המוצהר הוא אנגלית. בנוסף, המאגר כולל תכתובות מייל ישנות ויומני צ'אט משנות האלפיים המוקדמות שמכילים מידע אישי של אנשים אמיתיים. כרטיס המאגר מציין כי פרטי הסינון המדויקים וניתוח ההטיות חסרים בתיעוד הבסיסי, ולכן צריך לבדוק רעילות לפני שמכניסים תוצרים למוצר.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

אין למאגר רישיון מסחרי אחיד, והוא מוגדר תחת רישיון כללי מסוג other. כל אחד מ־22 המקורות הגיע עם תנאים משלו, למשל מקורות מסוימים תחת MIT ואחרים עם הגבלות אחרות. מי שבונה מודל מסחרי חייב לבדוק את הרישיונות של החלקים שבהם הוא משתמש כדי להימנע מהפרת זכויות יוצרים.

כמה נפח אחסון צריך כדי להוריד את המאגר?

המאגר שוקל 825 GiB במצבו המקורי ומכיל מאות מיליארדי רשומות. מומלץ להחזיק כונן ייעודי של לפחות 1.5 טרה-בייט לצורך פריקה ועיבוד ראשוני של הקבצים. אם אין לכם מקום כזה, אפשר לעבוד עם הזרמת נתונים או להוריד רק תת-מאגרים ספציפיים.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מוגדר רשמית עבור השפה האנגלית בלבד. תת-המאגר של Europarl מכיל מעט שפות אירופאיות אחרות, אך עברית אינה חלק מהאיסוף. לאימון מודל בעברית תצטרכו לחפש מקורות נתונים אחרים.

מאיפה נאספו הנתונים?

החומרים נאספו מ־22 מאגרי מידע קיימים באינטרנט. הם כוללים קוד מ־GitHub, מאמרים מ־PubMed, פטנטים מ־USPTO, מיילים מפרשת Enron, ודיונים מ־Hacker News ומערוצי IRC של אובונטו. המטרה היתה לחבר מקורות מקצועיים שונים כדי לקבל שפה עשירה ומגוונת.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה באמצעות הסקריפט pile.py שמוגדר במאגר, ללא צורך בהרשאת גישה מיוחדת. בגלל שמדובר ב־825 GiB ובטווח של מעל 100 מיליארד רשומות, חובה לדאוג מראש לנפח אחסון מקומי רחב או להשתמש בהזרמת נתונים כדי לא לקרוס. השדות העיקריים בכל דגימה הם שדה הטקסט text ושדה המטא-דאטה meta.

from datasets import load_dataset

ds = load_dataset("EleutherAI/pile")

הרישיון

הרישיון הכללי מוגדר בתור רישיון אחר (other). המאגר מאחד מקורות שונים עם תנאים משלהם, למשל PubMed Central שמופץ תחת רישיון MIT. המשמעות היא שאין פה רישיון אחיד. לפני שמאמנים מודל למטרות מסחריות, צריך לבדוק בנפרד את הזכויות של כל אחד מ־22 המקורות כדי לוודא שאין בהם הגבלות שמונעות שימוש כזה.

הרישיון המלא ב־Hugging Face ↗