GPT
O

openwebtext

קוד פתוח

Skylion007cc0-1.02022-03-02

שחזור קוד פתוח של WebText ששימש לאימון GPT-2 המקורי. הוא מרכז דפי רשת באנגלית ששותפו ברדיט ומספק טקסט נקי יחסית לאימון מודלי שפה.

  • 54,008הורדות בחודש
  • 531לייקים

מה זה

המאגר מציע שחזור עצמאי של WebText מבית OpenAI, שפותח באוניברסיטת בראון על ידי אהרון גוקאסלן ווניה כהן. המטרה היתה לייצר קורפוס אימון פתוח שמחקה את המקור ששימש לאימון GPT-2, ללא תלות בקבצים הסגורים של החברה.

הבסיס מורכב מקישורים שחולצו מפוסטים ברדיט. היוצרים סיננו תוכן שאינו HTML, חילצו את גוף הכתבות באמצעות ספריית newspaper, והשתמשו ב־FastText כדי לסנן כל מה שאינו אנגלית. לאחר מכן הופעל מנגנון MinHash LSH על גבי 5-גרמים כדי לזרוק כפילויות ברמת דמיון מעל 0.5, וסוננו מסמכים קצרים שמכילים פחות מ־128 טוקנים.

התוצאה כוללת 8,013,769 מסמכים בחלוקה יחידה של train. אין פה חלוקה מובנית למבחן או אימות, ואין תיוגים מיוחדים. כל רשומה כוללת שדה מחרוזת בודד בשם text, שמכיל את הטקסט הגולמי כפי שחולץ מהאתר.

מתאים ל

  • אימון מודלי שפה באנגלית

    טקסט מגוון ונקי יחסית לאימון מקדים של מודלי שפה מסוג text-generation מאפס או להמשך אימון.

  • אימון מודלי fill-mask

    מסמכים באורך של מעל 128 טוקנים שמתאימים למשימות מיסוך בסגנון BERT בשפה האנגלית.

  • שחזור מחקרים על GPT-2

    בחינה והשוואה של ארכיטקטורות על גבי קורפוס שמדמה ישירות את נתוני המקור של מודלי GPT-2.

איפה זה נופל

הכרטיס מצהיר על אנגלית בלבד ומבוסס על קישורים מרדיט, מה שמכתיב הטיה חזקה לתחומי העניין והדמוגרפיה של הפלטפורמה הזו. מעבר לכך, הכרטיס משאיר כמעט את כל סעיפי המגבלות וההטיות תחת חוסר מידע. לא בוצע כאן סינון רעילות, מידע אישי או תוכן רגיש מעבר לסינון כפילויות ואורך מינימלי. למי שבונה מודל בעברית, המאגר הזה פשוט חסר תועלת כיוון שכל תוכן שאינו באנגלית נזרק מראש על ידי FastText.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא. היוצרים השתמשו בכלי הזיהוי של FastText וסיננו החוצה כל עמוד שלא זוהה כשפה האנגלית. המאגר מכיל אנגלית בלבד.

האם מותר להשתמש במאגר למוצרים מסחריים?

האריזה והקוד שוחררו תחת cc0-1.0 שמאפשר שימוש מסחרי חופשי ללא חובת ייחוס. עם זאת, היוצרים מציינים שאינם הבעלים של הטקסטים שנאספו מהרשת. מי שמאמן מודל מסחרי צריך לקחת בחשבון את המעמד המשפטי של טקסטים שנאספו ללא אישור מפורש מבעלי האתרים.

כמה מקום בדיסק צריך כדי לעבוד איתו?

קובצי ההורדה דורשים כ־24.19 ג'יגה בייט. לאחר פריסה וייצור הנתונים, המאגר תופס 39.77 ג'יגה בייט נוספים. סך שטח הדיסק המוצהר בשימוש מלא מגיע לכ־63.96 ג'יגה בייט.

איך בדיוק נאספו הנתונים?

היוצרים לקחו קישורים שפורסמו בפוסטים ברדיט וסיננו קישורים שאינם HTML. לאחר מכן הם חילצו את גוף הדפים באמצעות ספריית newspaper, הורידו כפילויות בעזרת MinHash LSH וזרקו עמודים קצרים מ־128 טוקנים ועמודים שאינם באנגלית.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה, בלי צורך באישור גישה או מפתח פרטי. הקבצים מגיעים מחולקים ל־80 קובצי parquet תחת plain_text. גודל ההורדה שצוין בכרטיס הוא 24.19 ג'יגה בייט, והדאטה המיוצר תופס 39.77 ג'יגה בייט, כשלפי התיעוד נדרשים עד 63.96 ג'יגה בייט שטח דיסק בעבודה איתו. המבנה מינימליסטי לחלוטין: פונים ישירות לשדה text כדי לשלוף את התוכן בכל רשומה.

from datasets import load_dataset

ds = load_dataset("Skylion007/openwebtext")

הרישיון

היוצרים שחררו את אריזת הנתונים תחת רישיון cc0-1.0 לרשות הציבור, ללא צורך בייחוס וללא דרישת שיתוף זהה. יחד עם זאת, הם מבהירים מפורשות שאין להם בעלות על הטקסטים עצמם שנאספו מרחבי הרשת, ומחזיקים מנגנון להסרת תכנים מוגנים לפי דרישה. מותר לאמן מודלים לשימוש מסחרי, אך הסיכון המשפטי על זכויות היוצרים של הטקסט המקורי נשאר אצלכם.

הרישיון המלא ב־Hugging Face ↗