GPT
P

pythia-12b-deduped

קוד פתוח

EleutherAIapache-2.02023-02-27

  • transformers
  • pytorch
  • gpt_neox
  • text-generation
  • causal-lm

זה מודל בסיס פתוח שנועד לחקר שפה ולמידה פנימית של רשתות. היתרון שלו הוא שקיפות מוחלטת, שכוללת נתוני אימון ללא כפילויות וגישה לנקודות ביקורת לאורך כל שלבי הריצה.

  • 2,048טוקנים בהקשר
  • 22.2 GBמשקל הקבצים
  • 4,590הורדות בחודש
  • 52לייקים

מה זה

המודל מגיע מבית היוצר של EleutherAI והוא חלק מסדרת מחקר שלמה. הרעיון כאן היה לבודד משתנים. 12 מיליארד הפרמטרים שלו אומנו על מאגר The Pile שעבר ניקוי כפילויות גלובלי, בדיוק באותו סדר נתונים שבו אומנו שאר הגדלים בסדרה. בניגוד למודלים מקבילים כמו OPT או GPT-Neo, הדגש בפיתוח לא הושם על שבירת שיאים במשימות ספציפיות, אלא על יצירת קרקע אחידה למדידה מדעית.

למרות זאת, מפתחי המודל מדווחים כי הביצועים שלו במבחנים מקבילים או עולים על אלו של ארכיטקטורות אחרות באותו סדר גודל. נקודת החוזק האמיתית למפתחים וחוקרים היא היכולת לחזור אחורה בזמן. ישנן 154 נקודות שמירה שונות שפזורות לאורך תהליך הלמידה שלו, מצעד האפס ועד סוף האימון, מה שמאפשר לחקור בדיוק מתי המודל תופס תבניות לשוניות מסוימות.

מתאים ל

  • מחקר יכולות הסקה

    גישה לעשרות נקודות שמירה מאפשרת לעקוב אחרי השינויים בפרמטרים לאורך תהליך האימון.

  • בסיס לכוונון ייעודי

    הארכיטקטורה הפתוחה והרישיון הנוח מאפשרים לאמן אותו מאפס למשימות ארגוניות באנגלית.

  • בדיקת השפעת כפילויות מידע

    השוואה ישירה מול הגרסה שלא עברה deduping מאפשרת להבין את השפעת ניקוי הדאטה.

איפה זה נופל

זה אינו צ'אטבוט ואין כאן כוונון להוראות או למידה ממשוב אנושי. אם תשאלו אותו שאלה, הוא ינסה להשלים את הטקסט הבא ולא יענה כמו מוצר מלוטש. בנוסף, חלון ההקשר קצר מאוד ועומד על 2,048 טוקנים בלבד, מה שמקשה על עיבוד מסמכים ארוכים. המודל אומן באנגלית בלבד ולכן הוא אינו מתאים לטקסט בעברית או לתרגום. נתוני האימון מכילים טקסטים בוטים ופוגעניים מהרשת, והוא עשוי לפלוט אמירות לא הולמות או עובדות שגויות לחלוטין.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בשביל שיחה בעברית?

לא. המודל הוגדר ואומן על מקורות באנגלית בלבד. אין לו תמיכה רשמית בשפות אחרות וכל ניסיון לייצר בעזרתו טקסט בעברית יוביל לפלטים שבורים.

במה הגרסה הזו שונה מהגרסה הרגילה של 12B?

ההבדל היחיד הוא במאגר הנתונים. גרסה זו אומנה על The Pile אחרי שנוקו ממנו כפילויות גלובליות, מה שמשפיע על אופן שינון המידע ועל ביצועי המודל.

איך מריצים

המשקלים תופסים 22.2 גיגה בייט בדיוק של float16 ומחולקים לעשרה קבצים. כדי לטעון אותו לזיכרון בלי קריסות ולבצע הסקה, תצטרכו כרטיס מסך עם לפחות 24 גיגה בייט זיכרון גרפי ייעודי, או לחלק את השכבות על גבי כמה מאיצים בעזרת ספריית transformers וארכיטקטורת GPTNeoX.

אם אתם רוצים רק מודל שיענה למשתמשים ולא עוסקים במחקר פנימי, עדיף להשתמש במודל מכוונן הוראות דרך שירות ענן חיצוני. הרצה מקומית של הגודל הזה כבדה, והיא מוצדקת בעיקר כשרוצים לבצע כוונון עדין על דאטה ייחודי או להשוות שלבי אימון בין נקודות השמירה השונות.

from transformers import pipeline

pipe = pipeline("text-generation", model="EleutherAI/pythia-12b-deduped")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של המשקלים, כוונון עדין והפצה של המערכת בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעות זכויות היוצרים והצהרת שינויים. המפתחים מדגישים שאם אתם מבססים עליו מוצר, עליכם לבצע הערכת סיכונים והטיות בעצמכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗