GPT
T

TinyStories-1M

קוד פתוח

roneneldanרישיון לא דווח2023-05-12

  • transformers
  • pytorch
  • gpt_neo
  • text-generation
  • endpoints_compatible

הפרויקט הזה מכווץ יצירת טקסט למיליון פרמטרים בודדים על בסיס דאטה סינתטי של סיפורי ילדים. הוא מתאים למי שרוצה לחקור איך מודל זעיר מייצר משפטים תקינים בלי לשרוף משאבים.

  • 2,048טוקנים בהקשר
  • 49.5 MBמשקל הקבצים
  • 228,928הורדות בחודש
  • 70לייקים

מה זה

הארכיטקטורה כאן היא GPTNeo שמיועדת ליצירת טקסט, אבל עם מיליון פרמטרים בלבד ובמשקל כולל של פחות מחמישים מגה-בייט. המודל אומן על מאגר TinyStories, שמורכב מסיפורים קצרים בעלי אוצר מילים של ילדים קטנים. המטרה של הניסוי הזה הייתה לבדוק אם רשת קטנה מאוד יכולה ללמוד דקדוק, עקביות ומבנה נרטיבי בסיסי כשהתוכן ממוקד ופשוט.

בגודל הזה, המודל מצליח להשלים משפטים פשוטים באנגלית בצורה סבירה. הוא שונה ממה שקיים כי רוב מודלי השפה הקטנים נעצרים בעשרות או מאות מיליוני פרמטרים, בעוד שכאן חתכו ישירות לעצם כדי לבודד את יכולות הליבה של הארכיטקטורה.

מתאים ל

  • מחקר של מודלי שפה

    מאפשר לבדוק שינויים בארכיטקטורה ומשקלים מקומית בלי לחכות לשעות אימון והסקה יקרות.

  • בדיקות אוטומציה ו־CI

    רץ מיד כמודל דמה בטסטים של קוד שבודק пайпליין של יצירת טקסט.

  • הדגמות חינוכיות

    מתאים ללימוד מושגי בסיס בלמידת מכונה על מחשב אישי בלי תלות בחומרה כבדה.

איפה זה נופל

אל תצפו להגיון מורכב, ידע כללי או יכולת לנהל שיחה. הוא אומן רק על עולם המושגים של סיפורי ילדים פשוטים, וברגע שתבקשו ממנו משהו מחוץ לאנגלית בסיסית מאוד, פקודות קוד או עובדות מדעיות, הוא יפלוט טקסט חסר פשר. עברית כמובן לא קיימת פה בכלל, וגם הקשרים ארוכים מעבר לכמה משפטים בודדים יתפרקו מהר מאוד.

אותה משפחה

TinyStories יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן על סיפורי ילדים קצרים באנגלית בלבד. אם תזינו לו קלט בעברית הוא יחזיר תוצאות לא שמישות.

האם צריך GPU כדי להריץ אותו?

ממש לא. הקבצים שוקלים פחות מחמישים מגה-בייט, ומעבד רגיל של כל מחשב מריץ אותו במהירות גבוהה בלי מאמץ.

איך מריצים

טוענים את המודל ישירות דרך ספריית transformers בפייתון עם AutoModelForCausalLM, יחד עם הטוקנייזר של EleutherAI/gpt-neo-125M. המשקל של הקבצים עומד על 49.5 מגה-בייט בדיוק של float32, כך שלא צריך שום כרטיס מסך ייעודי ואפשר להריץ אותו בשבריר שנייה על כל מעבד של מחשב נייד או שרת זול.

אין שום סיבה להשתמש ב־API חיצוני במקרה הזה. המשקל קטן עד כדי כך שהתקשורת ברשת תיקח יותר זמן מחישוב הטוקנים המקומי, מה שהופך אותו לפתרון נוח לבדיקות מקומיות בסביבת פיתוח מנותקת.

from transformers import pipeline

pipe = pipeline("text-generation", model="roneneldan/TinyStories-1M")
print(pipe("שלום"))

הרישיון

היוצר לא הגדיר רישיון בעמוד של המודל. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין לכם אישור מפורש לשלב אותו במוצר מסחרי או להפיץ אותו מחדש. אם אתם בונים מערכת ללקוחות, כדאי להיזהר ולא להכניס אותו לקוד שלכם.

הרישיון המלא בעמוד המודל ↗