GPT
P

pythia-70m

קוד פתוח

EleutherAIapache-2.02023-02-13

  • gpt-neox
  • pytorch
  • safetensors
  • gpt_neox
  • causal-lm

זה מודל שפה זעיר שנבנה במקור לחקר תהליכי למידה ולא לשיחה עם משתמשים. הוא מעניין חוקרים ומפתחים בעיקר בגלל הגישה לנקודות ביקורת לאורך כל תהליך האימון.

  • 96Mפרמטרים
  • 2,048טוקנים בהקשר
  • 319 MBמשקל הקבצים
  • 464,345הורדות בחודש

מה זה

מדובר במודל הקטן ביותר בסדרת המחקר של EleutherAI, שנבנה במיוחד כדי לחקור שקיפות והתנהגות של מודלי שפה לאורך ציר הזמן. המפתחים אימנו אותו על מאגר The Pile המכיל מגוון טקסטים באנגלית, בלי סינון כפילויות, תוך שמירה מדויקת על סדר הנתונים וההגדרות במקביל לגדלים האחרים בסדרה.

התוצאות במבחנים משקפות בדיוק את מה שמצפים ממודל של כ־96 מיליון פרמטרים. במבחני הבנה וידע כללי הוא מציג ציונים נמוכים מאוד, כמו 25.9 ב־MMLU או 0.3 בלבד ב־GSM8K, שמעידים על חוסר יכולת כמעט מוחלט לפתור בעיות מתמטיות או להסיק מסקנות מורכבות. הוא יודע לחזות את המילה הבאה באנגלית, לא מעבר לזה.

מתאים ל

  • מחקר על תהליכי אימון

    154 נקודות הביקורת השמורות מאפשרות לבדוק בדיוק מתי המודל רוכש תכונות מסוימות.

  • אימון נוסף למשימה ממוקדת

    הגודל הזעיר מאפשר לבצע עליו fine-tuning מהיר וזול במיוחד למשימות סיווג קלות באנגלית.

  • בדיקות תשתית וצנרת קוד

    המשקל הנמוך הופך אותו למושלם לבדיקות CI ובדיקת תהליכי הרצה מקומיים בלי להעמיס על הזיכרון.

איפה זה נופל

הוא לא מוצר ולא צ'אטבוט. לא עשו לו כוונון עדין למענה על שאלות או התאמה להוראות אנושיות, ולכן הוא לא עונה כמו כלי שיחה אלא פשוט ממשיך טקסטים באופן עיוור. בנוסף, המאגר שעליו הוא אומן מכיל שפה גסה, תוכן פוגעני והטיות מתועדות בגזע ומגדר, כך שהוא עלול לייצר פלטים בעייתיים גם מקלט תמים. אין לו תמיכה בעברית, והוא נכשל כמעט לגמרי במשימות חישוב והיגיון.

אותה משפחה

pythia יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מבין או מייצר עברית?

לא. המודל אומן על נתונים בשפה האנגלית בלבד, ואינו מתאים לשום שימוש, עיבוד או תרגום בעברית.

אפשר להשתמש בו בתור בוט שירות או עוזר וירטואלי?

ממש לא. הוא לא עבר התאמה להוראות, אין לו יכולת שיחה, והוא פשוט ינחש טוקנים בלי להבין שפניתם אליו בשאלה.

מה ההבדל בין המשקלים הראשיים לנקודות הביקורת האחרות?

הגרסה בראש הענף מייצגת את סוף האימון בצעד 143,000. שאר הענפים מכילים שמירות ביניים מוקדמות שמיועדות לחוקרים שרוצים לבחון את שלבי הלמידה.

איך מריצים

בגודל של 319 מגה־בייט ושישה שכבות בלבד, אפשר להריץ אותו כמעט על כל מעבד רגיל, לפטופ פשוט או סביבת פיתוח בסיסית, בלי לחשוב בכלל על כרטיסי מסך חזקים. משתמשים בספריית transformers הרגילה של Hugging Face עם GPTNeoXForCausalLM וטוענים את המשקלים ישירות.

מי שרוצה לעקוב אחרי השינויים הפנימיים בלמידה יכול למשוך ענפים ספציפיים מתוך 154 נקודות הביקורת שנשמרו. אין שום היגיון לשלם ל־API חיצוני עבור גודל כזה, כי העלות החישובית של הרצה מקומית אפסית לחלוטין.

pip install -U huggingface_hub
hf download EleutherAI/pythia-70m

הקבצים

8 קבצים במאגר, 319 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי לחלוטין לצרכים אישיים ומסחריים. מותר לשנות אותו, לבצע עליו אימון נוסף ולשלב אותו במוצרים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗