GPT
T

t5-v1_1-xxl

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • t5
  • text2text-generation

גרסת בסיס עצומה בארכיטקטורת טקסט לטקסט שמיועדת לאימון המשך בלבד. מי שבוחר בה מחפש נקודת פתיחה נקייה של גוגל למשימות מורכבות באנגלית.

  • 83.0 GBמשקל הקבצים
  • 204,198הורדות בחודש
  • 151לייקים

מה זה

גוגל שחררו את הגרסה הזו כעדכון למבנה המקורי של T5. יש כאן ארכיטקטורת Sequence to Sequence עם שינויים פנימיים מורגשים: מעבר לאקטיבציית GEGLU במקום ReLU, ביטול שיתוף המשקולות בין שכבת ה־embedding ל־classifier, ושינוי בממדים הפנימיים לעומת גרסת ה־11B הישנה.

ההבדל הקריטי ביותר מול הגרסה הראשונה נוגע לנתוני האימון. כאן ביצעו אימון מקדים על קורפוס C4 בלבד, בלי לערבב משימות מונחות (supervised tasks) פנימה. בנוסף כיבו את מנגנון ה־Dropout בזמן האימון המקדים כדי לשפר את איכות הייצוגים, מה שהופך את המשקלים למאגר ידע גולמי ומאסיבי מאוד, אבל כזה שלא יודע לענות ישירות על שום הוראה שתתנו לו.

מתאים ל

  • בסיס לכוונון משימות באנגלית

    נקודת מוצא גדולה מאוד לאימון מותאם על נתונים פנימיים, ללא השפעה של משימות קודמות.

  • מחקר על ארכיטקטורת T5

    מתאים לניתוח השפעת שינויים כמו שכבות GEGLU וביטול שיתוף משקולות בסדרי גודל ענקיים.

  • בניית מודלי שפה ייעודיים

    מאפשר לארגונים עם כוח מחשוב להכשיר כלי לסיווג או תמצות מורכב לפי דרישה ספציפית.

איפה זה נופל

המודל הזה לא עובד ישר מהקופסה. התיעוד מציין במפורש שהוא עבר אימון מקדים בלבד על C4, ללא שום משימת המשך, ולכן הוא לא מתאים לשימוש ישיר כמנוע שיחה, תרגום או תמצות. תצטרכו להשקיע משאבים בכוונון עדין משלכם, ובזמן התהליך הזה חובה להפעיל מחדש את ה־Dropout. בנוסף, הוא אומן על אנגלית בלבד ולא מיועד לעברית.

שאלות
נפוצות

האם אפשר להוריד את המודל ולהתחיל להפיק ממנו תשובות?

לא. המודל עבר pre-training בלבד על מאגר C4 ללא משימות בפיקוח, כך שהוא לא יחזיר פלטים הגיוניים לפרומפטים רגילים. חייבים לבצע עליו fine-tuning לפני שאפשר להשתמש בו ליישום כלשהו.

איזה שינוי טכני צריך לזכור כשמאמנים אותו?

במהלך האימון המקדים גוגל כיבו את מנגנון ה־Dropout כדי לשפר את הביצועים. התיעוד מדגיש שחובה להפעיל את ה־Dropout בחזרה כשאתם נכנסים לשלב הכוונון העדין.

איך מריצים

כדי לעבוד איתו צריך תשתית רצינית. מדובר על 83 גיגה-בייט של קבצי משקלים שמגיעים בתשעה חלקים, כך שגם לטעינה בסיסית בזיכרון תצטרכו שרת עם מספר כרטיסי GPU חזקים מאוד או מאיצי TPU, בטח אם אתם מתכננים לאמן אותו.

המערך הזה מיועד לשימוש דרך transformers, אבל אם אין לכם אשכול מחשוב ייעודי כדי לבצע עליו כוונון עדין ולהחזיק אותו באוויר, אין שום סיבה לנסות להרים אותו מקומית. עדיף בהרבה לחפש גרסה שכבר עברה fine-tuning או לפנות לפתרונות API קיימים.

from transformers import pipeline

pipe = pipeline("text-generation", model="google/t5-v1_1-xxl")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו מודלים נגזרים ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗