GPT
T

tiny_shakespeare

קוד פתוח

karpathyרישיון לא דווח2022-03-02

המאגר כולל 40,000 שורות ממחזות שונים של שייקספיר בקובץ טקסט רציף. הוא מיועד לבדיקות מהירות, לימוד ואימון מודלים פשוטים ברמת התו.

  • 3,988הורדות בחודש
  • 91לייקים

מה זה

הנתונים מורכבים מטקסט גולמי שנלקח ממגוון מחזות של שייקספיר, בדיוק כפי שהופיע בפוסט המוכר של אנדריי קרפטי מ־2015 על רשתות חוזרות. המבנה אינו מחולק לשורות בודדות ברמת הדאטהסט של Hugging Face, אלא מוגש כרשומה אחת יחידה המכילה שדה טקסט ארוך בכל אחד מהחלקים.

הכרטיס אינו מפרט תהליכי סינון, ניקוי או פרטים על איסוף המקור מעבר לכך שמדובר במחזות שונים. החלוקה הפנימית מציגה שורה אחת בכל חלק, כאשר המאגר מפוצל ל־train, validation ו־test ללא פירוט נוסף לגבי נקודות החיתוך המדויקות בין המחזות.

מתאים ל

  • אימון מודל תווים

    בדיקת ארכיטקטורות RNN או שנאים קטנים ברמת התו על טקסט רציף.

  • בדיקת צינורות עיבוד

    הרצה מהירה של קוד אימון מקומי כדי לוודא שהצינור רץ בלי תקלות.

  • הדגמות והוראה

    הוראת עקרונות יצירת טקסט על נתונים קטנים שנטענים בשניות ספורות.

איפה זה נופל

הטקסט כולו כתוב באנגלית עתיקה של מחזות שייקספיר, ללא שום ייצוג לעברית או לשפה מודרנית כלשהי. הכרטיס אינו מפרט הטיות, מגבלות או מידע על תוכן רגיש. לא הייתי משתמש בזה למודל שאמור לשרת משתמשים אמיתיים, כי הסגנון התיאטרלי והתחביר אינם רלוונטיים למשימות שפה יומיומיות.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

בכרטיס הנתונים לא דווח רישיון כלל. ללא הצהרת רישיון מפורשת, אי אפשר להבטיח שמותר להשתמש בו למוצרים מסחריים.

כמה מקום המאגר תופס במחשב?

הקובץ להורדה שוקל 1.11 מגה בייט בלבד. סך המקום שהוא דורש בדיסק מגיע ל־2.23 מגה בייט.

האם יש במאגר טקסט בעברית?

אין במאגר עברית כלל. כל 40,000 השורות נלקחו ממחזות שייקספיר באנגלית בלבד.

איך מחולק המידע בין הפיצולים?

בכל אחד מחלקי האימון, האימות והבדיקה יש רשומה אחת בלבד. הרשומה הזו כוללת שדה טקסט ארוך שצריך לפצל עצמאית בקוד.

איך טוענים

טוענים אותו ישירות דרך ספריית datasets באמצעות השם tiny_shakespeare ללא צורך בהרשאות גישה. גודל הקבצים להורדה עומד על 1.11 מגה בייט ותופס כ־2.23 מגה בייט על הדיסק, כך שהוא נטען מיד לזיכרון. השדה היחיד שקיים הוא text שמכיל מחרוזת, ולכן נדרש עיבוד מוקדם כדי לפרק אותו לתווים או למילים.

from datasets import load_dataset

ds = load_dataset("karpathy/tiny_shakespeare")

הרישיון

הרישיון של המאגר לא דווח כלל בכרטיס. כשאין רישיון מוגדר, מבחינה משפטית אין אישור שימוש ברור, כולל למטרות מסחריות, ויש לקחת בחשבון סיכון בהטמעת מודלים שאומנו עליו במוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗