GPT
T

T0pp

קוד פתוח

bigscienceapache-2.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • t5
  • text2text-generation

גרסת הקצה המורחבת של משפחת T0 שמבצעת משימות חדשות באנגלית בלי אימון מוקדם. החוקרים הראו שהיא עוקפת את GPT-3 בחלק מהמבחנים למרות שהיא קטנה ממנו פי 16.

  • 11Bפרמטרים
  • 83.0 GBמשקל הקבצים
  • 34,370הורדות בחודש
  • 403לייקים

מה זה

בבסיס יושב מודל אנקודר דקודר ממשפחת T5 שעבר התאמה עם מטרת שפה רגילה, ואז כוונון על עשרות מאגרי נתונים מנוסחים כהוראות טקסטואליות. הרעיון היה להמיר משימות מובנות של עיבוד שפה טבעית לתבניות פרומפטים מגוונות, כדי לבדוק איך המודל מתמודד עם בקשות חדשות לחלוטין.

גרסת T0pp מכילה את שילוב הדאטה הרחב ביותר בסדרה. מעבר למאגרים הבסיסיים של שאלות ותשובות, סיווג וסיכום, הוסיפו לה את מערכי ההערכה של GPT-3 וחלקים מ־SuperGLUE כמו BoolQ ו־MultiRC. המבחנים על משימות שלא נראו באימון הראו ביצועים עדיפים בממוצע על פני הגרסאות הקודמות בסדרה, במיוחד במבחני זיהוי הטיות שפה והבנת הנקרא.

מתאים ל

  • סיווג טקסט באנגלית

    ניתוח סנטימנט או חלוקה לקטגוריות על בסיס הוראות ישירות בלי לאמן מסווג ייעודי.

  • הבנת הנקרא ומענה לשאלות

    חילוץ תשובות מתוך פסקאות נתונות בהתבסס על האימון הנרחב במאגרי SuperGLUE.

  • זיהוי כפילויות ופרפרזות

    בדיקה אם שני משפטים באנגלית מביעים את אותה המשמעות או שואלים את אותה שאלה.

איפה זה נופל

המודל מוגבל אך ורק לאנגלית ולא מסוגל לטפל בקוד או בעברית בגלל מגבלות הטוקנייזר. הוא רגיש מאוד לניסוח הפרומפט, ושינוי קל במילים משנה את איכות התשובה. הבעיה הקשה ביותר היא בקרת התוכן: הכרטיס מציג תשובות הזויות ומטרידות לשאלות פשוטות, החל מקביעה שכדור הארץ שטוח וחיסונים גורמים לאוטיזם, ועד יצירת תכנים מיניים בוטים ללא קשר לשאלה. אי אפשר לשלב אותו במערכת מול משתמשים בלי שכבת סינון אגרסיבית.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. ארכיטקטורת הטוקנייזר והאימון נבנו עבור אנגלית בלבד. ניסיון להזין טקסט בעברית ייכשל או יחזיר פלט משובש.

באיזה דיוק חישוב צריך להריץ את המודל?

היוצרים ממליצים להשתמש ב־bf16 או fp32 בלבד. הם מציינים במפורש להימנע מהרצה ב־fp16 בגלל האופן שבו המודל אומן במקור.

מה ההבדל בין T0 המקורי ל־T0pp?

גרסת T0pp מכילה אימון על מאגרי נתונים נוספים, כולל משימות מ־SuperGLUE ומערך ההערכה של GPT-3, מה שנותן לה ביצועים ממוצעים גבוהים יותר במשימות שלא נראו באימון.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־83 גיגה בייט עבור 11 מיליארד פרמטרים. כדי לטעון אותו תצטרכו מערך של כמה כרטיסי מסך חזקים עם שימוש במקבול, או שרת ייעודי בענן. שימו לב להנחיה הטכנית החריגה בכרטיס: המודל אומן עם אקטיבציות ב־bf16, והיוצרים מזהירים במפורש לא להריץ אותו ב־fp16 אלא רק ב־bf16 או fp32.

אם אין לכם תשתית עם חומרה מתאימה לתמיכה ב־bf16, כדאי לשקול את גרסת T0_3B שמכילה 3 מיליארד פרמטרים בלבד ודורשת פחות משאבים, או להשתמש בנקודת קצה מנוהלת דרך ספק צד שלישי.

from transformers import pipeline

pipe = pipeline("text-generation", model="bigscience/T0pp")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 83.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. אין כאן הגבלות שימוש מיוחדות על תוצרי המודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗