GPT
P

pythia-160m

קוד פתוח

EleutherAIapache-2.02023-02-08

  • transformers
  • pytorch
  • safetensors
  • gpt_neox
  • text-generation

כלי מחקר קל במיוחד שמיועד לבדיקת התנהגות מודלי שפה לאורך תהליך האימון. הוא שווה בדיקה רק אם אתם חוקרים ייצוגים פנימיים או צריכים בסיס זעיר לכוונון.

  • 213Mפרמטרים
  • 2,048טוקנים בהקשר
  • 717 MBמשקל הקבצים
  • 3,443,534הורדות בחודש

מה זה

המודל הזה נבנה כחלק מסדרת ניסוי שנועדה לאפשר מחקר מבוקר על מודלי שפה, ובפרט על תחום הפירוש וההבנה של מה שקורה בתוכם. הוא מאומן על קורפוס The Pile באנגלית בלבד, בדיוק באותו סדר נתונים ובאותם פרמטרים כמו שאר הגדלים בסדרה. הוא מגיע עם גישה ל־154 נקודות ביניים שונות לאורך 143 אלף צעדי האימון, מה שמאפשר לבדוק שלב אחרי שלב איך רשת לומדת מושגים.

בגודל של סביב מאתיים מיליון פרמטרים, הוא משתווה למודלים ותיקים כמו GPT-Neo 125M או OPT-125M. הוא לא עבר התאמה לשיחה עם בני אדם או מעקב אחר הוראות, אלא רק חיזוי הטוקן הבא. במבחנים סטנדרטיים הוא מציג ביצועים דומים או מעט עדיפים על מקביליו באותה קטגוריית גודל, אבל המטרה העיקרית שלו היא מדעית ולא תחרות על איכות טקסט חופשי.

מתאים ל

  • מחקר על תהליך האימון

    גישה ישירה ל־154 צעדי ביניים מאפשרת לבדוק בדיוק באיזה שלב נרכש כל דפוס לשוני.

  • פיתוח כלי פירוש ומדידה

    הארכיטקטורה הקטנה מקלה על ניתוח פנימי של שכבות, קשרים ומשקולות בלי צווארי בקבוק.

  • כוונון זול למשימות סיווג

    המשקל הנמוך מאפשר אימון מהיר וזול על חומרה בסיסית למשימות ספציפיות באנגלית.

איפה זה נופל

הוא לא מבין עברית, פולט הזיות ללא שום הבטחה לעובדות, ולא עבר שום שלב של יישור או למידה ממשוב אנושי. בגלל שהאימון נעשה על The Pile בלי סינון כפילויות, הוא עלול לייצר תוכן פוגעני, קללות או הטיות בעייתיות גם כשלא ביקשתם. אם תתנו לו פקודה ישירה כמו לצ'אטבוט, הוא פשוט ימשיך את המשפט במקום לענות עליו ברצינות.

אותה משפחה

pythia יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לבניית צ'אטבוט לשירות לקוחות?

ממש לא. הוא לא אומן לענות על שאלות או לנהל שיחה, ויענה פשוט ברצף מילים סטטיסטי שיכול להיות לא הגיוני או גס.

מה ההבדל בין ענף main לשאר הגרסאות בעמוד?

הענף הראשי מכיל את המודל המוגמר בסוף צעד 143,000. שאר הענפים הם עותקים שנשמרו בנקודות זמן מוקדמות יותר של האימון לצרכי מחקר והשוואה.

איך מריצים

המשקל הכולל יושב על כ־717 מגה בייט, כך שאפשר לטעון ולהריץ אותו ישירות בזיכרון של כל מחשב נייד פשוט, אפילו על מעבד רגיל בלי מאיץ גרפי ייעודי. טוענים אותו ישירות דרך ספריית transformers הרגילה של פייתון, וניתן לבחור כל ענף ספציפי כדי לטעון צעד אימון מסוים.

אם אתם צריכים רק בדיקה מהירה של השלמת טקסט, השרתים של Hugging Face מחזיקים ממשק מוכן, אבל בגודל כזה אין שום סיבה טכנית לשלם על API חיצוני. ההרצה המקומית מיידית וצורכת מעט מאוד משאבים.

from transformers import pipeline

pipe = pipeline("text-generation", model="EleutherAI/pythia-160m")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 717 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לכוונן אותו ולהפיץ מוצרים שמבוססים עליו, כל עוד שומרים על הודעת הרישיון המקורית ומציינים שינויים אם נעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗