GPT
G

gpt-neox-20b

קוד פתוח

EleutherAIapache-2.02022-04-07

  • transformers
  • pytorch
  • safetensors
  • gpt_neox
  • text-generation

זה מודל בסיס פתוח שמתאים בעיקר למי שרוצה לחקור ייצוג שפה או לאמן שכבה עליונה בעצמו, בלי להיות כבול לתשתיות סגורות.

  • 21Bפרמטרים
  • 2,048טוקנים בהקשר
  • 76.9 GBמשקל הקבצים
  • 731,350הורדות בחודש

מה זה

מדובר במודל שפה גולמי של 20 מיליארד פרמטרים שאומן על מאגר The Pile, הכולל טקסטים מגוונים באנגלית כמו מאמרים אקדמיים, קוד גיטהאב וכתוביות וידאו. המבנה שלו דומה למשפחת ה־GPT המקורית ומשתמש בקידוד מיקום יחסי מסוג RoPE. הוא אינו מיושר למשתמש, כך שהוא פשוט חוזה את הרצף הסטטיסטי הבא של הטקסט ולא מנהל שיחה.

במבחני zero shot מול מודלים אחרים מתקופתו, הוא עוקף מודלים קטנים יותר כמו GPT-J ו־FairSeq 13B במשימות כמו ARC Challenge עם ציון 0.380, ומגיע ל־0.928 ב־SciQ. מצד שני, במבחני ידע כללי ושאלות טריוויה הוא השיג 0.259 בלבד, רחוק מ־GPT-3 DaVinci, ובמדדי פתרון בעיות מתמטיות בסיסיות הוא מציג יכולת אפסית כמעט.

מתאים ל

  • אימון ייעודי למשימות ספציפיות

    הוא משמש בסיס טוב להתאמה אישית של מודל פנימי באנגלית כשיש דאטהסט ייעודי.

  • מחקר אקדמי על שפה

    הוא מאפשר חילוץ ייצוגי שפה וניתוח של מודלי ענק עם ארכיטקטורה ודאטה גלויים לגמרי.

  • השלמת טקסטים אוטומטית

    הוא מבצע חיזוי רצף סטטיסטי להמשך כתיבה באנגלית ללא צורך במבנה שיחה.

איפה זה נופל

המודל פועל באנגלית בלבד ואינו מתאים לעברית. הוא לא עבר שום אימון להוראות או משוב אנושי, כך שהוא לא יודע להתנהג כמו צ'אטבוט ויפלוט טקסטים מוזרים או לא קשורים בתגובה לבקשות ישירות.

מאגר האימון שלו לא עבר סינון כפילויות ומכיל שפה פוגענית והטיות חברתיות מתועדות. הוא נוטה להמציא עובדות בביטחון, והתוצאות בלוח המבחנים הפתוח מעידות על קריסה מוחלטת במשימות חישוב עם ציון 2.43 בלבד ב־GSM8K. אסור לחבר אותו למשתמשי קצה ללא פיקוח הדוק.

שאלות
נפוצות

האם המודל מבין או מייצר עברית?

לא. המודל אומן על The Pile שמורכב מאנגלית בלבד. כל ניסיון לכתוב אליו בעברית יפיק פלט שבור או חסר משמעות לחלוטין.

האם אפשר להשתמש בו כמו תחליף פתוח לצ'אטבוט?

לא באופן ישיר. המודל לא עבר שום התאמה להוראות או דיאלוג, ולכן הוא רק ינסה להמשיך את המשפט הבא במקום לענות לשאלות.

איך מריצים

כדי להריץ אותו מקומית צריך להתמודד עם משקל קבצים של 76.9 גיגה בייט ב־102 חלקים שונים, בדיוק float16. המודל דורש זיכרון וידאו עצום של מעל 40 גיגה בייט רק כדי להיטען, מה שמחייב שימוש בכמה כרטיסי מסך חזקים במקביל עם חלוקת שכבות או מודל מקבילי.

אפשר לטעון אותו ישירות דרך ספריית transformers בקוד פייתון קצר. למי שאין שרת ייעודי עם חומרה מתאימה, החזקה של שרת כזה תעלה הרבה מאוד כסף, וברוב המקרים עדיף לבדוק חלופות מנוהלות אלא אם המטרה היא התאמה ואימון עצמאי.

from transformers import pipeline

pipe = pipeline("text-generation", model="EleutherAI/gpt-neox-20b")
print(pipe("שלום"))

הקבצים

102 קבצים במאגר, 76.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקולות, והפצה מחדש בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית, לצד ביצוע הערכת סיכונים עצמאית לפני פריסה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗