GPT
P

pythia-12b

קוד פתוח

EleutherAIapache-2.02023-02-28

  • transformers
  • pytorch
  • safetensors
  • gpt_neox
  • text-generation

זהו מודל שפה פתוח לחלוטין באנגלית שנועד למחקר מדעי על אופן הלמידה של מודלים. הוא מעניין בעיקר בזכות 154 נקודות שמירה לאורך כל תהליך האימון שלו.

  • 12Bפרמטרים
  • 2,048טוקנים בהקשר
  • 44.4 GBמשקל הקבצים
  • 25,947הורדות בחודש

מה זה

הפרויקט הזה נבנה על ידי EleutherAI ככלי למחקר אינטרפרטביליות, כלומר הבנה של מה בדיוק קורה בתוך רשתות נוירונים עמוקות בזמן שהן לומדות. בניגוד לרוב המודלים שמשוחררים רק בגרסתם הסופית, כאן המפתחים שחררו גישה לכל שלבי הביניים, החל מצעד האפס, דרך צעדים מוקדמים במרווחים לוגריתמיים, ועד לנקודות ביקורת קבועות בכל אלף צעדים עד לצעד 143,000. כל הגדלים במשפחה הזו אומנו בדיוק על אותם נתונים ובאותו סדר, מה שמאפשר להשוות התנהגויות בין גדלים שונים באופן מבוקר ונקי לחלוטין.

הוא אומן על The Pile בגרסה המקורית שלו ללא הסרת כפילויות, על פני כמעט שלוש מאות מיליארד טוקנים באנגלית. למרות שיוצריו לא כיוונו מראש למקסום ביצועים במשימות קצה, המדידות מראות שהוא משתווה ולעיתים עוקף מודלים בגודל דומה מסדרות כמו OPT או GPT-Neo. עם זאת, הוא אינו מודל שיחה ולא עבר אימון עם משוב אנושי. הוא פשוט מנחש את הטוקן הבא ברצף, ולכן מתאים כבסיס גולמי לעבודה ולא כמוצר מוכן לשימוש ישיר.

מתאים ל

  • מחקר התפתחות ייצוגים

    154 נקודות השמירה מאפשרות לבדוק מתי בדיוק תכונות וידע נקלטו ברשת לאורך האימון.

  • בסיס לאימון המשך

    משקל פתוח תחת רישיון אפאצ'י שמאפשר לבצע fine-tuning למשימות ייעודיות באנגלית.

  • השוואת גדלים מבוקרת

    אימון זהה לחלוטין לכל גודלי הסדרה מאפשר לבודד את השפעת כמות הפרמטרים נטו.

איפה זה נופל

הוא לא מבין עברית ולא מיועד לתרגום, אלא אך ורק לאנגלית. מעבר לזה, המודל אומן על The Pile ללא סינון כפילויות, מאגר שמכיל שפה בוטה, קללות והטיות מתועדות סביב מגדר, גזע ודת. הוא עלול לפלוט תוכן פוגעני גם אם הקלט נקי לחלוטין. הוא לא עבר התאמה להוראות או סינון בטיחותי, ולכן אסור לחבר אותו ישירות למשתמשי קצה ללא סינון אנושי. חלון ההקשר קצר יחסית ועומד על 2,048 טוקנים בלבד.

אותה משפחה

pythia יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להשתמש בו בתור צ'אטבוט לשירות לקוחות?

לא ישר מהקופסה. המודל לא עבר שום כיוונון להוראות או שיחה, והוא רק משלים טקסט סטטיסטי. בנוסף, המאגר עליו אומן כולל טקסטים בוטים והטיות, כך שהוא עלול לייצר תשובות לא הולמות ללא אימון נוסף וסינון כבד.

האם הוא מבין או מייצר עברית?

הוא הוגדר ואומן על מאגר נתונים באנגלית בלבד. כל ניסיון לתת לו קלט בעברית יניב תוצאות שבורות, חסרות היגיון או גיבוב של תווים, והוא לא מתאים למשימות בשפה זו כלל.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־44.4 גיגה בייט בפורמט float16, מה שאומר שאתם חייבים לפחות 24 עד 30 גיגה בייט של זיכרון וידאו ייעודי בכרטיס מסך כדי רק לטעון אותו להסקה בסיסית בלי קוונטיזציה. אפשר להריץ אותו עם ספריית transformers של Hugging Face וארכיטקטורת GPTNeoX, אבל הוא דורש חומרה מקצועית כמו כרטיס A100 או שרשור של כמה כרטיסים צרכניים חזקים.

הריצה העצמית שווה את המאמץ והעלויות רק אם אתם חוקרים את השינויים לאורך שלבי האימון וצריכים גישה לנקודות הביקורת השונות, או שאתם מאמנים מודל המשך על חומרה מקומית. אם אתם סתם צריכים טקסט באנגלית או השלמת משפטים, פנייה ל־API מסחרי תהיה זולה, מהירה ופשוטה בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="EleutherAI/pythia-12b")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו, לאמן עליו מודלים נוספים ולהפיץ אותו בחופשיות. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, והיוצרים מציינים שאם אתם מבססים עליו מוצר, עליכם לבצע הערכת סיכונים והטיות בעצמכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗