GPT
T

TinyStories

קוד פתוח

roneneldancdla-sharing-1.02023-05-12

מאגר של סיפורים קצרים באנגלית עם אוצר מילים מצומצם שנוצרו על ידי בינה מלאכותית. הוא מתאים למי שרוצה לאמן מודלים קטנים מאוד ולבדוק יכולות הבנה ודקדוק בלי לשרוף משאבי חישוב ענקיים.

  • 85,094הורדות בחודש
  • 1,146לייקים

מה זה

המאגר מכיל סיפורים קצרים שנוצרו בצורה סינתטית באמצעות המודלים GPT-3.5 ו־GPT-4. הרעיון המרכזי מאחורי הנתונים הוא שימוש באוצר מילים מוגבל שמתאים לילדים צעירים, במטרה לבחון יצירת טקסט תקין מבחינה תחבירית ונרטיבית על ידי רשתות נוירונים בעלות מספר פרמטרים נמוך יחסית. הכרטיס אינו מפרט תהליכי סינון מורכבים מעבר להנחיות היצירה המקוריות.

מבנה המאגר מחולק לקבצים שונים. הגרסה המקורית כוללת קובצי אימון ואימות בשם TinyStories-train.txt ו־TinyStories-valid.txt, ששימשו לאימון המודלים המוזכרים במאמר. לצידם קיים קובץ TinyStoriesV2-GPT4-train.txt, שכולל טקסטים שנוצרו רק על ידי GPT-4 ונחשבים לאיכותיים יותר מהפלט של GPT-3.5. בנוסף, קובץ הארכיון tinystories_all_data.tar.gz כולל שכבת מידע רחבה יותר, יחד עם הפרומפטים ששימשו ליצירת הסיפורים ומטא-דאטה נלווה.

מתאים ל

  • אימון מודלים זעירים

    בדיקת יכולות תחביר וסיפור במודלים של מיליוני פרמטרים בודדים.

  • מחקר על שפה סינתטית

    ניתוח האופן שבו מודלים לומדים מטקסט שיוצר על ידי בינה מלאכותית.

  • בנצ'מרק והערכת מודלים

    מדידת ביצועי יצירה עקבית בעזרת קובץ הפרומפטים המצורף למאגר.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין כאן אף מילה בעברית או בשפות אחרות. התוכן סינתטי לחלוטין ומוגבל לאוצר מילים של ילדים, כך שהוא אינו משקף שפה אנושית מורכבת, עגה, עובדות אמיתיות או ידע מקצועי. המאגר אינו מתאים לבניית כלי כללי לעיבוד שפה טבעית, והוא נשען על הטיות אפשריות של המודלים שיצרו אותו במאי 2023.

שאלות
נפוצות

האם יש במאגר תמיכה בעברית?

לא. כל הנתונים במאגר נוצרו באנגלית בלבד, מתוך מטרה לחקור אוצר מילים פשוט באנגלית. לא ניתן להשתמש בו לאימון מודלים בעברית ללא תרגום חיצוני.

מה ההבדל בין קובץ הרכבת הרגיל לגרסה השנייה?

הקובץ המקורי כולל סיפורים שנכתבו גם על ידי GPT-3.5 וגם על ידי GPT-4. הגרסה השנייה TinyStoriesV2 מבוססת על GPT-4 בלבד, היא גדולה יותר ומכילה פלטים באיכות גבוהה יותר.

האם הדאטהסט מתאים לפיתוח צ'אטבוט עסקי?

ממש לא. מדובר בסיפורי ילדים קצרים וסינתטיים עם אוצר מילים בסיסי מאוד. מודל שילמד עליו לא יכיר עובדות מציאותיות, לא יידע לענות על שאלות ולא יתמודד עם ניסוחים מקצועיים.

איך טוענים

הנתונים מחולקים בעיקר לקובצי טקסט פשוטים בפורמט txt לצד קובץ דחוס בפורמט tar.gz. הגישה אליהם חופשית לחלוטין ואינה דורשת אישור מיוחד או הרשמה אצל היוצר, כך שניתן להוריד אותם ישירות מתוך Hugging Face. מי שמחפש רק את הטקסט הנקי יכול לעבוד ישירות מול קובצי ה־txt המוכנים של האימון והאימות. אם אתם זקוקים לפרומפטים ששימשו לייצור הדאטה או לנתוני מטא נוספים, תצטרכו לפתוח את קובץ הארכיון המלא. קיימים במאגר גם קובץ הגדרות הערכה מסוג yaml וקובץ מערך npy.

from datasets import load_dataset

ds = load_dataset("roneneldan/TinyStories")

הרישיון

המאגר מופץ ברישיון cdla-sharing-1.0. רישיון זה מאפשר שיתוף ושימוש בנתונים, כולל למטרות מסחריות, תוך שמירה על ייחוס מתאים. עם זאת, אם אתם מפרסמים שינויים או הרחבות של הדאטהסט עצמו, חלה חובה לשתף אותם תחת אותו הרישיון בדיוק. לגבי תוצרי אימון ומודלים, הרישיון מתמקד בנתונים עצמם ולא בהכרח כובל את המודל, אך מומלץ לבדוק את תנאי המקור של החברות שייצרו את המידע הסינתטי.

הרישיון המלא ב־Hugging Face ↗