GPT
U

ul2

קוד פתוח

googleapache-2.02022-06-16

  • transformers
  • pytorch
  • t5
  • text2text-generation
  • en

מודל אנקודר דקודר של 20 מיליארד פרמטרים מבית גוגל. שילוב של משימות אימון שונות מאפשר לו להתמודד בהצלחה עם הבנת שפה, יצירת טקסט ופתרון בעיות בהקשר קצר.

  • 512טוקנים בהקשר
  • 36.7 GBמשקל הקבצים
  • 2,465הורדות בחודש
  • 182לייקים

מה זה

גוגל אימנו את המודל הזה על טריליון טוקנים ממאגר C4 במטרה לאחד שיטות אימון שונות תחת קורת גג אחת. במקום להסתמך רק על ניחוש המילה הבאה כמו מודלים בסגנון GPT או רק על שחזור מקטעים חסרים כמו T5, הוא משלב שלושה סוגי משימות: שחזור מקטעים רגיל, השלמת טקסט עוקבת, ושחזור קיצוני של קטעים ארוכים שנמחקו. הבחירה במצב העבודה נעשית באמצעות הוספת תגיות ייעודיות בתחילת הקלט, כמו S2S או NLU.

לפי נתוני המחקר של גוגל, הארכיטקטורה הזו עקפה את GPT-3 בגודל 175B במבחן SuperGLUE ללא דוגמאות מוקדמות, ושילשה את הביצועים של T5-XXL במשימות סיכום עם דוגמה בודדת. המודל עבר גם כוונון עדין על 50 משימות שונות במקביל לאימון, מה שהופך אותו לבסיס חזק יחסית לניתוח טקסט ולהסקה ישירה באנגלית.

מתאים ל

  • סיווג טקסטים קצרים באנגלית

    ניתוח והבנה של קטעי טקסט ממוקדים תחת תגית NLU, תחום שבו הארכיטקטורה הציגה תוצאות חזקות במבחני SuperGLUE.

  • סיכום פסקאות באנגלית

    יצירת סיכומים תמציתיים מטקסטים קצרים יחסית, תחום שבו המודל עקף משמעותית גרסאות קודמות של T5.

  • השלמת משפטים ומקטעים חסרים

    שחזור מידע וחלקי טקסט חסרים באמצעות מנגנון ה־MoD והתגיות המובנות של המודל.

איפה זה נופל

המגבלה הבולטת ביותר היא חלון ההקשר. המודל מוגבל ל־512 טוקנים בלבד לקלט ולפלט. אי אפשר להזין לו מסמכים ארוכים, קוד מורכב או שיחות מתמשכות בלי לחתוך את הטקסט בצורה אגרסיבית. בנוסף, המודל אומן על אנגלית בלבד ומבוסס על אוצר מילים של T5 בגודל 32,000 טוקנים, כך שאין לו תמיכה אמיתית בעברית. הוא גם דורש שימוש בתגיות ספציפיות כדי להפיק ממנו ביצועים טובים, ואינו מתנהג כמו מודל צ'אט מודרני.

שאלות
נפוצות

האם המודל תומך בעבודה עם טקסטים בעברית?

לא. המודל אומן על מאגר C4 באנגלית בלבד ומשתמש בטוקנייזר של T5 שלא מתאים לשפות שאינן נתמכות. הרצה של טקסט בעברית תגרום לפירוק יתר של מילים לטוקנים ולתוצאות פגומות.

למה כדאי להשתמש בו ולא במודל מסדרת GPT?

הוא מתאים במיוחד למשימות מובנות של אנקודר דקודר כמו סיווג, שחזור טקסט ועיבוד שפה קלאסי. אם המטרה היא יצירת שיחה חופשית או טקסטים ארוכים, הוא פחות מתאים עקב חלון הקשר של 512 טוקנים.

איך מריצים

כדי להריץ את 14 הקבצים ששוקלים יחד 36.7 ג'יגה בייט בדיוק bfloat16, חייבים חומרה חזקה. כרטיס A100 עם 40GB זיכרון הוא המינימום הנדרש להרצה בסיסית, ובלי חומרה ברמה הזו המודל פשוט לא ייטען. הוא נתמך ישירות בספריית transformers תחת הארכיטקטורה T5ForConditionalGeneration.

אם אין לכם שרת ייעודי עם מאיצים מתאימים, אין טעם לנסות להרים אותו על מחשב מקומי. במקרים כאלה עדיף לפנות למודלים מודרניים יותר שזמינים כשירות ענן, או לבחור מודלים קטנים בהרבה שדורשים פחות משאבים לתחזוקה שוטפת.

from transformers import pipeline

pipe = pipeline("text-generation", model="google/ul2")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של המשקולות ושילוב שלהן במוצרים סגורים. התנאים העיקריים דורשים שמירה על הודעת זכויות היוצרים וציון השינויים שנעשו בקוד או במודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗