GPT
S

SimpleStories

קוד פתוח

SimpleStoriesmit2024-09-04

  • NLP
  • Distillation

מעל שני מיליון סיפורים קצרים באנגלית שנוצרו בידי מודלים כדי לאמן רשתות שפה זעירות וניתנות לפענוח. המאגר נבנה בהשראת TinyStories עם דגש על גיוון תחבירי ותיוג מושגי.

  • 3,036הורדות בחודש
  • 36לייקים

מה זה

המאגר מכיל סיפורים קצרים באנגלית שנוצרו באופן סינתטי על ידי מודלים משנת 2024. היוצרים הסתמכו על מחולל ייעודי עם גרעיני יצירה כדי להשיג מגוון סמנטי ותחבירי רחב יותר בהשוואה לפרויקטים דומים. הטקסט כולו מוגבל לתווי ASCII בלבד, והרשומות כוללות תיוגים ברמה גבוהה כמו נושא, סגנון ותמה, לצד מדדי עיבוד שפה טבעית שחושבו מראש כדי להקל על סינון.

מבחינת בטיחות וסינון, הכותבים הריצו בדיקה אוטומטית שפסלה הופעה של ביטויים פוגעניים או מונחים הקשורים לנשק ביולוגי, כימי, רדיולוגי וגרעיני. הסינון התבסס על רשימת מונחים גסים של שאטרסטוק ורשימה מותאמת אישית של סיכוני לוחמה לא קונבנציונלית. החלוקה במאגר מורכבת מפיצול אימון המופץ בשבעה קבצי פרקט ומפיצול בדיקה בקובץ פרקט יחיד.

מתאים ל

  • אימון מודלי שפה זעירים

    בניית מודלים של מיליוני פרמטרים בודדים על טקסט באוצר מילים מבוקר ופשוט.

  • מחקר יכולת פענוח

    חקר מנגנוני הפעולה הפנימיים של רשתות נוירונים על נתונים סינתטיים מובנים.

  • סינון לפי סגנון ותמות

    אימון מודלים מותאמים אישית באמצעות השדות המתוייגים מראש כמו נושא וסגנון.

איפה זה נופל

זהו טקסט סינתטי לגמרי שנוצר על ידי מודלים ולא בידי בני אדם, מה שמכניס עיוותים ודפוסים שחוזרים על עצמם. המאגר מוגבל לאנגלית בלבד ובנוי אך ורק מתווי ASCII, כך שאינו רלוונטי בכלל למי שמפתח בעברית. בנוסף, רמת השפה מותאמת לסיפורים פשוטים וקצרים, ולכן הוא לא מתאים לאימון מודל שאמור להתמודד עם הנמקה מורכבת, עולם מקצועי או שיחה עסקית.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן, רישיון MIT מתיר במפורש שימוש מסחרי, מחקרי ופרטי. אין שום דרישה לפתוח את הקוד שלכם או לחלוק את המודל המאומן. כל מה שנדרש זה לכלול את עותק הרישיון והקרדיט המקורי.

האם יש במאגר טקסטים בעברית?

לא. המאגר הספציפי הזה כולל אנגלית בלבד ומוגבל לתווי ASCII ללא תמיכה בשפות שמיות. היוצרים מציינים קיומה של גרסה ביפנית ואפשרות להזמין שפות אחרות, אך המאגר הנוכחי אינו כולל שום עברית.

במה הוא שונה מ־TinyStories המוכר?

המאגר נוצר בהשראת TinyStories אבל משתמש במודלים חדשים יותר משנת 2024 ובגרעיני יצירה מגוונים יותר. בנוסף, הוא כולל תיוגים מפורשים של סגנון, נושא ומדדי שפה טבעית לכל סיפור, מה שמאפשר לסנן נתונים בדיוק רב יותר.

איך טוענים

טוענים את המאגר ישירות מספרית הדאטהסטס של האגינג פייס לפי הנתיב הרשמי, בלי שום צורך לבקש אישור גישה מוקדם. הנתונים שמורים בעשרה קבצי פרקט שמחולקים לאימון ובדיקה. ברשומות תמצאו מעבר לטקסט הסיפור גם שדות של תגיות כמו סגנון, נושא ומדדי איכות טקסטואליים, שמאפשרים לחתוך החוצה דוגמאות שלא מתאימות ליעד שלכם עוד לפני שלב הטוקניזציה.

from datasets import load_dataset

ds = load_dataset("SimpleStories/SimpleStories")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הטקסטים והפצה מחדש, ואינו מחייב אתכם לשחרר מודלים שאימנתם תחת אותו רישיון. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שמשתמשת בנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗