GPT
G

gpt-neo-125m

קוד פתוח

EleutherAImit2022-03-02

  • transformers
  • pytorch
  • jax
  • rust
  • safetensors

מודל אנגלי קטן במיוחד שמשחזר את ארכיטקטורת GPT-3 על 150 מיליון פרמטרים. הוא נבנה כדי להציע חלופה קלה ופתוחה לחלוטין לניסויים מקומיים מהירים.

  • 150Mפרמטרים
  • 2,048טוקנים בהקשר
  • 1.9 GBמשקל הקבצים
  • 522,717הורדות בחודש

מה זה

מדובר במודל שפת מאומן מראש שפותח על ידי EleutherAI כחלק מסדרת GPT-Neo, במטרה לשחזר את עקרונות הפעולה של GPT-3. הוא אומן על מאגר הנתונים The Pile לאורך 300 מיליארד טוקנים ו־572,300 צעדים, תוך התמקדות בחיזוי הטוקן הבא באנגלית בלבד. התוצאה היא כלי קומפקטי שמיועד בעיקר לחילוץ מאפיינים למשימות המשך או לייצור רצפי טקסט קצרים מקלט נתון.

מבחני הביצועים מציגים תמונה מפוכחת לגבי היכולות שלו. במדד GSM8K לבדיקת פתרון בעיות מתמטיות הוא עומד על 0.3 בלבד, ובמבחן DROP על 3.69, מה שמלמד שהוא לא מבין לוגיקה מורכבת או שאלות הסקה כמותיות. גם במבחני ARC ו־MMLU הציונים נעים סביב 22 עד 26, קרוב מאוד לטווח הניחוש האקראי. הוא כן מגיע ל־51.78 במבחן Winogrande, מה שמראה רמה סבירה של השלמת משפטים פשוטה, אבל לא מעבר לזה.

מתאים ל

  • מחקר והוראה

    משקל קל של 1.9 גיגה בייט שמאפשר להבין לעומק מודלים שפתיים על חומרה ביתית פשוטה.

  • אימון fine-tuning ייעודי

    בסיס התחלתי זול שרץ על 150 מיליון פרמטרים ומתאים למשימות סיווג מקומיות באנגלית.

  • השלמת טקסט קצר

    יצירת המשכים למשפטים קיימים באנגלית כשרק מהירות העיבוד המקומית קובעת.

איפה זה נופל

המודל אומן על The Pile, מאגר שכולל שפה בוטה, קללות ותכנים פוגעניים. היוצרים עצמם מבהירים שהוא עלול לייצר פלטים לא הולמים בלי שום אזהרה, וממליצים להפעיל סינון אנושי לפני שחושפים תוצרים למשתמשים. מעבר לכך, התוצאות במבחנים מוכיחות שהוא חסר יכולת פתרון בעיות, מוגבל לאנגלית בלבד, ואינו מתאים לשום משימה שדורשת דיוק עובדתי או הבנה מעמיקה.

אותה משפחה

gpt-neo יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לייצור טקסט בעברית?

לא. המודל אומן על מאגר The Pile באנגלית בלבד. הוא לא מכיר את השפה העברית ולא יפיק פלטים הגיוניים בה.

האם אפשר לסמוך עליו בחישובים או בניתוח לוגי?

ממש לא. התוצאה שלו במבחן GSM8K היא 0.3 ובמבחן DROP היא 3.69, מה שמעיד על היעדר יכולת חישובית או לוגית.

האם כדאי לשלב אותו ישירות בצ'אטבוט מול לקוחות?

לא מומלץ כלל. יוצרי המודל מזהירים במפורש שהוא עלול לייצר פלטים בוטים ולא מבוקרים, וממליצים להפעיל סינון אנושי על התוצרים.

איך מריצים

המודל שוקל 1.9 גיגה בייט בלבד ורץ ישירות דרך ספריית transformers בפייתון עם pipeline בסיסי של text-generation. בזכות הגודל הצנוע שלו, אין צורך בשרתים מיוחדים ואפשר להריץ אותו בלי שום בעיה על כרטיס גרפי ביתי פשוט, ואפילו ישירות על מעבד רגיל במחשב פיתוח נייד.

אם כל מה שאתם צריכים זה לחקור ארכיטקטורה, לבדוק רעיונות למחקר או לעשות fine-tuning נקודתי וזול על נתונים משלכם, הרצה עצמית כאן היא מהירה ואינה דורשת משאבים כמעט. לעומת זאת, אם המטרה היא לקבל טקסט קוהרנטי באיכות גבוהה או מענה מדויק למשתמשי קצה, חבל על זמן ההתעסקות במודל הזה ועדיף לפנות למודל מתקדם יותר דרך API מסחרי.

from transformers import pipeline

pipe = pipeline("text-generation", model="EleutherAI/gpt-neo-125m")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר חופש כמעט מוחלט. מותר להשתמש בו לצרכים אישיים ומסחריים, לשנות את הקוד והמשקלים, להפיץ אותו מחדש או להטמיע אותו בתוך מוצר סגור. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗