GPT
O

openwebtext-10k

קוד פתוח

stasרישיון לא דווח2022-03-02

דגימה קטנה של עשרת אלפים רשומות מתוך השחזור הפתוח ל־WebText של OpenAI. היא מיועדת לבדיקות מהירות של קוד ותהליכי אימון בלי להוריד עשרות ג'יגהבייט.

  • 3,258הורדות בחודש
  • 32לייקים

מה זה

המאגר כולל עשרת אלפים רשומות טקסט בלבד, שנלקחו ישירות מתחילת הדאטהסט הפתוח OpenWebText. במקור, הפרויקט הזה נועד לשחזר את נתוני האימון ש־OpenAI השתמשה בהם עבור GPT-2 על בסיס דפי אינטרנט שהקישורים אליהם שותפו ברשת, אבל החיתוך המסוים הזה שמר רק את החלק הראשון מתוכם לצורכי בדיקה.

המבנה פשוט מאוד. אין כאן חלוקה מורכבת לסטים שונים אלא רק פיצול אימון יחיד שמכיל שדה בודד בשם text. כל רשומה מייצגת מסמך טקסטואלי גולמי, בדיוק כפי שנשלף ונשמר במאגר המקורי בן שמונת מיליון הרשומות.

מי שיצר את הדגימה הזו הוא המשתמש stas, שצירף קובץ הוראות בשם process.txt שמסביר איך בדיוק נחתך המאגר מתוך המקור. אין בכרטיס פירוט נוסף על סינונים מיוחדים שנעשו מעבר לשליפת עשרת אלפים השורות הראשונות.

מתאים ל

  • בדיקת תהליכי אימון

    הרצה מקומית קצרה על המחשב כדי לוודא שקוד הטעינה והטוקניזציה עובד בלי שגיאות לפני שמשקיעים כסף בשרתים.

  • פיתוח כלי עיבוד טקסט

    בדיקה מהירה של סקריפטים לניקוי נתונים, חלוקה למשפטים או המרה לפורמטים שונים על קובץ קל משקל.

  • ניפוי שגיאות בצינור נתונים

    הרצת בדיקות אוטומטיות במערכות אינטגרציה רציפה שדורשות דוגמת טקסט חופשי בלי זמני הורדה ארוכים.

איפה זה נופל

זה לא מאגר שמאמנים עליו מודל אמיתי. עשרת אלפים רשומות זה גודל זעיר שמספיק רק כדי לוודא שהפייפליין שלכם לא קורס על שגיאות תחביר או זיכרון. מעבר לזה, הטקסט מבוסס על OpenWebText המקורי, כלומר מדובר בתוכן אינטרנט ישן באנגלית בלי שום תיעוד בכרטיס לגבי נוכחות של עברית, סינון רעלים או הטיות שנכנסו מהרשת. אם אתם בונים משהו שפונה למשתמשים, תצטרכו לבדוק את התכנים בעצמכם או לעבור למקור המלא.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא מומלץ בכלל. לא מוגדר שום רישיון במאגר, ולכן אין היתר שימוש מפורש, מסחרי או אחר. אם אתם צריכים נתונים למוצר מסחרי, כדאי לחפש חלופות עם רישיון ברור.

כמה מקום הדאטהסט תופס בדיסק?

ההורדה מכווצת לגודל של כ־15 מגהבייט. לאחר הפריקה בזיכרון או על הדיסק, הוא תופס סביב 50 מגהבייט בלבד.

האם יש במאגר טקסטים בעברית?

הכרטיס לא מציין שפות, אך המקור הוא OpenWebText שמבוסס בעיקר על דפי רשת באנגלית. ייתכן שיש פירורי מילים בשפות אחרות, אך המאגר אינו מיועד לעבודה בעברית.

מה ההבדל בינו לבין OpenWebText המלא?

מדובר פשוט בחיתוך של עשרת אלפים הרשומות הראשונות מתוך המאגר המלא, שכולל שמונה מיליון רשומות. המטרה כאן היא משקל קל לבדיקות, לא אימון מודלים מלאים.

איך טוענים

טוענים אותו בשורה אחת דרך הספרייה של Hugging Face עם הפקודה load_dataset('stas/openwebtext-10k'). המאגר ציבורי לחלוטין ולא דורש אישור גישה מראש. הוא שוקל כ־15 מגהבייט בצורה דחוסה וכ־50 מגהבייט כשהוא פתוח, כך שהוא יורד ונפתח תוך שניות בודדות. השדה היחיד שמעניין אתכם בקוד הוא text, ואם רוצים לעבוד עם קובץ מקומי אפשר לייצא אותו ישירות לפורמט jsonl עם פונקציית to_json.

from datasets import load_dataset

ds = load_dataset("stas/openwebtext-10k")

הרישיון

היוצר לא דיווח על רישיון עבור הדגימה הזו. כשאין רישיון מוגדר, מבחינה משפטית אין לכם הרשאה ברורה להשתמש בטקסטים לשום מטרה, בטח שלא מסחרית. זה אומר שאסור להפיץ מודל שאומן עליו בלי לקחת סיכון, ועדיף להתייחס אליו ככלי בדיקה מקומי בלבד בסביבת הפיתוח.

הרישיון המלא ב־Hugging Face ↗