GPT
O

openai-gpt

קוד פתוח

openai-communitymit2022-03-02

  • transformers
  • pytorch
  • tf
  • rust
  • safetensors

המודל הזה הוא הדור הראשון של משפחת GPT, שמתאים למי שחוקר את התפתחות התחום או מחפש משקל נוצה שמסוגל לרוץ על כמעט כל חומרה באנגלית בלבד.

  • 120Mפרמטרים
  • 512טוקנים בהקשר
  • 1.9 GBמשקל הקבצים
  • 198,186הורדות בחודש

מה זה

מדובר בארכיטקטורת שנאי בכיוון אחד עם 12 שכבות שאומנה על מאגר של מעל 7,000 ספרים שלא פורסמו. הוא יודע להמשיך טקסט, לבצע סיווגים בסיסיים, לבדוק דמיון סמנטי ולהבין הקשר פשוט מתוך ספרות. חלון ההקשר שלו נעצר ב־512 טוקנים, מה שאומר שהוא שוכח מהר מאוד מה קרה כמה פסקאות קודם לכן.

במדדי ההערכה הוא הגיע ל־89.9 אחוז דיוק ב־SNLI ו־91.3 אחוז בניתוח סנטימנט ב־SST-2, אבל במשימות של הבנת הנקרא כמו RACE הוא נעצר ב־59 אחוז בלבד. המספרים האלה מראים שהוא טוב יחסית בהתאמת דפוסים תחביריים ומבנים בסיסיים, אך מתקשה להחזיק היגיון מורכב לאורך זמן.

מתאים ל

  • מחקר והוראה של ארכיטקטורה

    הוא מדגים בצורה נקייה את הבסיס למודלי שפה מודרניים עם דרישות זיכרון אפסיות.

  • ניתוח סנטימנט באנגלית

    הוא השיג מעל תשעים אחוזי דיוק במאגר SST-2 ומתאים למשימות קלות במשאבים נמוכים.

  • בדיקות סמנטיות מקומיות

    הוא מחזיר ייצוגי שכבות פנימיות במהירות גבוהה על גבי מעבד רגיל.

איפה זה נופל

הוא לא אומן לייצר עובדות או לייצג מציאות, והמפתחים מציינים במפורש שהוא מייצר הטיות פוגעניות וסטריאוטיפים חברתיים. בנוסף, הוא מתנהג בצורה שבירה כשמציגים לו קלט שחורג מההתפלגות שעליה למד, ובמשימות קבילות לשונית ב־CoLA הוא צנח ל־45.4 אחוזי דיוק בלבד. הוא לא מכיר עברית, ומבנה הטקסטים שלמד מוגבל בעיקר לז'אנרים של הרפתקאות, רומנטיקה ופנטזיה.

שאלות
נפוצות

האם כדאי להשתמש בו לצ'אטבוט או למוצר חדש?

לא. המודל הזה הוגדר על ידי מפתחיו ככזה שלא מייצג עובדות, והוא נוטה לייצר הטיות ופלט שביר. חלון ההקשר שלו מוגבל ל־512 טוקנים, מה שלא מאפשר שיחה רציפה או מעקב אחר הנחיות מורכבות.

איך הוא מתמודד עם טקסטים בעברית?

הוא לא מתמודד איתם כלל. המודל אומן על טקסטים באנגלית בלבד מתוך מאגר BooksCorpus והוא אינו מיועד לפענוח או יצירה של שפות אחרות.

איך מריצים

אתם מושכים אותו ישירות דרך ספריית transformers בפייתון עם PyTorch או TensorFlow, והוא שוקל 1.9 גיגה בייט בלבד. בגלל הגודל הזעיר הזה של 120 מיליון פרמטרים, כל מעבד סטנדרטי במחשב נייד יריץ אותו בלי שום צורך בכרטיס מסך ייעודי.

אין שום סיבה לשלם ל־API חיצוני כדי לקרוא למודל בגודל הזה. ההרצה המקומית מיידית ופשוטה, וממילא אין שירותי ענן מסחריים שמתחזקים נקודת קצה ייעודית למודל היסטורי כזה כשאפשר פשוט להעלות אותו לזיכרון המקומי ברגע.

from transformers import pipeline

pipe = pipeline("text-generation", model="openai-community/openai-gpt")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון MIT, שזה רישיון מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה חוזרת במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗