GPT
T

tinystories-gpt4-clean

קוד פתוח

karpathycdla-sharing-1.02026-02-08

גרסה מהודקת ומסוננת של סיפורי TinyStories שמבוססת על GPT-4 בלבד. היא מיועדת למי שרוצה לאמן מודל שפה זעיר על אנגלית פשוטה בלי לכלוך ושאריות קידוד.

  • 985הורדות בחודש
  • 89לייקים

מה זה

המאגר מכיל 2,732,634 סיפורים קצרים שנלקחו מהדאטהסט המקורי של Eldan ו־Li, אך מתוך החלק שיוצר על ידי GPT-4 בלבד, ללא הדוגמאות של GPT-3.5. הטקסטים נבנו במקור כדי לבדוק איך מודלים קטנים לומדים דקדוק ועלילה בסיסית באנגלית, ואורכם החציוני עומד על 721 תווים.

תהליך הסינון מחק כ־12 אלף רשומות בעייתיות. הסינון כלל המרה של גרשיים ומקפים לצורתם הבסיסית, זריקה של כל טקסט שהכיל תווים שאינם ASCII, מחיקת סיפורים קצרים ממאה תווים, והסרת טקסטים שלא הסתיימו בסימן פיסוק תקין. בנוסף נזרקו סיפורים עם תווים כמו סוגריים מרובעים או תגיות שמקורם בשאריות של תבניות צ'אט ו־HTML.

מתאים ל

  • אימון מודלי שפה זעירים

    מתאים לבניית מודלי צעצוע של מיליוני פרמטרים בודדים שלומדים לייצר אנגלית תחבירית תקינה בזול.

  • בדיקות ארכיטקטורה וטוקניזציה

    מאפשר לבדוק שינויים בארכיטקטורות שנאי בלי לבזבז ימי חישוב על דאטהסטים ענקיים.

  • הוראה והדגמות קוד

    פורמט של קובץ יחיד שמקל על הרצת סדנאות ותרגולים מהירים בלמידת מכונה.

איפה זה נופל

אין כאן מילה אחת בעברית. המאגר כולל 74 תווי ASCII בלבד, כך שכל תו שאינו באנגלית בסיסית הוסר מראש. מודל שתאמנו עליו יוגבל לאוצר מילים של סיפורי ילדים קצרים ולא יכיר תחומים טכניים, עובדות מורכבות או מבנים שאינם סיפור פשוט. בנוסף, מדובר בטקסט סינתטי לחלוטין שנוצר על ידי מודל סגור, על כל הטיות הסגנון והחזרתיות של GPT-4.

שאלות
נפוצות

האם הדאטהסט כולל טקסט בעברית?

לא. המאגר סונן כך שיכיל רק 74 תווים בפורמט ASCII באנגלית בלבד. כל תו אחר, כולל אותיות בעברית או סימנים מיוחדים, נפסל בתהליך הניקוי.

במה הוא שונה מ־TinyStories המקורי?

הגרסה המקורית כללה כ־5 מיליון סיפורים שנוצרו בחלקם על ידי GPT-3.5 והכילו שגיאות קידוד. כאן נשמרו רק סיפורי GPT-4, ועברו סינון קפדני שהסיר תבניות פגומות ותווים שבורים.

האם מותר להשתמש בו לצרכים מסחריים?

הרישיון הוא cdla-sharing-1.0 שמאפשר שימוש חופשי ושיתוף של הנתונים, אך דורש לשמור על אותו רישיון אם מפיצים גרסה מעובדת של הדאטה. עם זאת, יש לזכור שהנתונים נוצרו במקור מ־GPT-4 של OpenAI.

כמה מקום ומשאבים צריך כדי להוריד אותו?

קובץ ה־parquet שוקל כ־673 מגה-בייט בלבד. אפשר להוריד ולטעון אותו בזיכרון של מחשב נייד רגיל תוך שניות, בלי צורך בשרתים ייעודיים.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה datasets של Hugging Face מהנתיב karpathy/tinystories-gpt4-clean ללא צורך באישור גישה. קובץ ה־parquet שוקל כ־673 מגה-בייט ומכיל עמודה אחת בלבד בשם text.

הנתונים מגיעים מעורבבים מראש. החלוקה המומלצת מפרידה את עשרת אלפים הסיפורים הראשונים לבדיקה, את עשרת אלפים הבאים לוולידציה, ואת כל היתר לאימון.

from datasets import load_dataset

ds = load_dataset("karpathy/tinystories-gpt4-clean")

הרישיון

המאגר מופץ תחת רישיון cdla-sharing-1.0. הרישיון מאפשר שימוש, שינוי ושיתוף של הנתונים, אך דורש שיתוף של כל שינוי בדאטהסט עצמו תחת אותם תנאים. עבור מודלים שמאומנים על הנתונים, חשוב לבדוק את התנאים המשפטיים לגבי שימוש בתוצרי אימון של מודלי OpenAI.

הרישיון המלא ב־Hugging Face ↗