GPT
P

pythia-410m

קוד פתוח

EleutherAIapache-2.02023-02-13

  • transformers
  • pytorch
  • safetensors
  • gpt_neox
  • text-generation

זה מודל קטן של חצי מיליארד פרמטרים שנבנה למחקר פנימי של רשתות נוירונים. מורידים אותו כשרוצים לנתח תהליכי אימון שלב אחרי שלב, או לחבר מודל בסיס קל למשימת התאמה צרה.

  • 506Mפרמטרים
  • 2,048טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 182,419הורדות בחודש

מה זה

הארכיטקטורה נשענת על GPTNeoXForCausalLM עם 24 שכבות, 506 מיליון פרמטרים וחלון הקשר באורך 2,048 טוקנים. הוא אומן על The Pile, מאגר של כ־825 גיגה בייט באנגלית שכולל מאמרים אקדמיים, קוד גיטהאב ותמלילי שיחות. לא מדובר במוצר שיחה מוכן שמחזיר תשובות מנוסחות למשתמשי קצה, אלא במודל חיזוי טוקנים טהור שמשלים טקסט.

הייחוד האמיתי שלו בהשוואה לאלטרנטיבות כמו OPT או GPT-Neo הוא השקיפות המלאה בתהליך ההכשרה. היוצרים מציעים 154 נקודות ביקורת שנשמרו לאורך 143,000 צעדי אימון תחת אותו סדר נתונים בדיוק. זה מאפשר לחוקרים לבדוק איך ידע מסוים נקלט ברשת על פני ציר הזמן, יתרון שלא קיים ברשתות סגורות או כאלה ששחררו רק משקולות סופיות.

מתאים ל

  • חקר יכולות תפיסה

    154 נקודות הביקורת השמורות מאפשרות מעקב מדויק אחר האופן שבו המודל מפתח ייצוגי שפה לאורך צעדי האימון.

  • בסיס לכוונון עדין

    משקל קל של 1.7 גיגה בייט שמתאים להרצה והתאמה מהירה למשימות סיווג ומיון ספציפיות על חומרה ביתית.

  • בדיקת השפעת כפילות נתונים

    קיומה של גרסה זהה שאומנה על דאטה שעבר ניקוי כפילויות מאפשר להשוות את השפעת הנתונים על אותם פרמטרים בדיוק.

איפה זה נופל

הוא לא עבר שום התאמה להוראות אנושיות, אימון בהעדפות או שיחות, ולכן הוא לא מתפקד כעוזר אישי. אם תזרקו עליו שאלה פתוחה, תקבלו השלמת טקסט עיוורת ולא תשובה מובנית. בנוסף, הוא תומך באנגלית בלבד ואינו יודע לייצר או לתרגם עברית. מאגר האימון שלו לא עבר סינון כפילויות ומכיל טקסטים גסים או פוגעניים מהרשת, כך שהוא מייצר הזיות, שגיאות עובדתיות וניסוחים בעייתיים בלי קשר לניסוח השאלה המקורית.

אותה משפחה

pythia יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית?

לא. המודל אומן על מאגר The Pile שמבוסס על השפה האנגלית בלבד, ואינו מתאים לייצור או תרגום טקסטים בעברית.

האם אפשר להשתמש בו ישירות כצ'אטבוט?

לא. המודל אינו מאומן לעקוב אחר פקודות או לנהל שיחה, אלא רק מנחש את הטוקן הבא ברצף. כדי לקבל צ'אטבוט תצטרכו לבצע עליו אימון והתאמה להוראות.

איך מריצים

המשקלים שוקלים 1.7 גיגה בייט בפורמט float16, מה שאומר שאפשר להריץ אותו כמעט על כל מחשב עם ספריית transformers, אפילו ישירות על מעבד רגיל או על כרטיס גרפי ביתי פשוט בלי חומרה ארגונית ייעודית. נקודת הביקורת הסופית זמינה כברירת מחדל בענף הראשי, ואת נקודות הביניים אפשר למשוך לפי שם הצעד.

אם כל מה שאתם צריכים זה מודל שיחה שמבין הקשרים מורכבים ועונה על שאלות משתמשים, עדיף בהרבה לפנות ל־API מסחרי מוכן. הרצה עצמית של המודל הזה מתאימה בעיקר כשיש צורך לחקור את התנהגות הרשת, או כשרוצים בסיס זול ביותר לאימון עצמי בסביבה מבודדת.

from transformers import pipeline

pipe = pipeline("text-generation", model="EleutherAI/pythia-410m")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל פיתוח מסחרי, שינוי המשקלים והפצה בתוך מוצרים. הדרישה העיקרית היא לצרף עותק של הרישיון המקורי ולתת קרדיט למפתחים. מי שמשתמש במודל כבסיס צריך לבצע בדיקות סיכונים והטיות בעצמו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗