GPT
F

flan-ul2

קוד פתוח

googleapache-2.02023-03-03

  • transformers
  • pytorch
  • t5
  • text2text-generation
  • flan-ul2

גרסת ענק של T5 עם 20 מיליארד פרמטרים שעברה אימון הוראות. היא מתאימה למי שצריך ארכיטקטורת קידוד ופענוח למשימות מובנות ולא רוצה להסתמך על מודלים גנרטיביים רגילים.

  • 512טוקנים בהקשר
  • 36.7 GBמשקל הקבצים
  • 936הורדות בחודש
  • 562לייקים

מה זה

מדובר במודל שמבוסס על שילוב של ארכיטקטורת T5 ושיטת אימון שנקראת Mixture of Denoisers. גוגל לקחו את UL2 המקורי ואימנו אותו מחדש על אוסף ההוראות של Flan, תוך ביטול הצורך בטוקנים מיוחדים להחלפת מצבי עבודה שהיו חובה בגרסה הקודמת. שדה הקליטה שלו הורחב מ־512 ל־2048 טוקנים כדי להתמודד טוב יותר עם דוגמאות בתוך הפרומפט.

במבחני ביצועים הוא עוקף את FLAN-T5-XXL בפער קטן, עם ציון של 55.7 במבחן MMLU לעומת 55.1, ומגיע ל־49.1 בממוצע הכללי. השיפור הבולט ביותר שלו נרשם במשימות חשיבה בשיטת שרשרת מחשבה, שם הוא מציג זינוק של 7.4 אחוזים ב־MMLU-CoT מול דגם ה־11B, אם כי הוא עדיין מפגר בהרבה אחרי מודלים ענקיים כמו FLAN-PaLM.

מתאים ל

  • מענה על שאלות עם הסבר

    מציג שיפור של 7.4 אחוזים במשימות שרשרת מחשבה לעומת דגמי T5 קודמים.

  • מיון וסיווג טקסטים

    ארכיטקטורת קידוד ופענוח מתאימה במיוחד להחזרת תוויות קצרות ומדויקות.

  • למידה מכמה דוגמאות

    הרחבת שדה הקליטה ל־2048 מאפשרת להכניס מספר דוגמאות פתורות ישירות לקלט.

איפה זה נופל

האימון התמקד במאגרי מידע אקדמיים ומשימות מוגדרות מראש, ולכן הוא פחות גמיש מול שיחות חופשיות או ניסוחים עמומים. למרות שהרחבת שדה הקליטה ל־2048 עוזרת בדוגמאות ספורות, חלון ההקשר הבסיסי נשאר מוגבל מאוד ביחס למקובל. בנוסף, הוא אומן בעיקר על טקסט באנגלית ממאגר C4, כך שביצועיו בעברית לא נבדקו וצפויים להיות ירודים.

שאלות
נפוצות

האם צריך להוסיף טוקנים מיוחדים לפרומפט כמו בגרסה המקורית?

לא. בגרסה הזו המודל אומן במשך 100 אלף צעדים נוספים כדי לבטל את התלות בטוקנים של החלפת מצבים, כך שאפשר לשלוח טקסט רגיל לגמרי.

האם הוא מתאים לשימוש בעברית?

האימון התבצע על מאגר C4 ומאגרי הוראות ממוקדים שכוללים שפות אירופיות בעיקר, ללא התאמה ייעודית לעברית. אפשר לנסות להריץ אותו, אך לא כדאי לבנות עליו לטקסטים מורכבים בעברית.

איך מריצים

כדי להריץ אותו מקומית ב־bfloat16 מלא תצטרכו לפחות 40 עד 45 ג'יגה־בייט של זיכרון כרטיס מסך, מה שמחייב שני כרטיסים של 24 ג'יגה־בייט או כרטיס שרת בודד של 48 או 80 ג'יגה־בייט. החבילות transformers ו־accelerate נתמכות ישירות ומאפשרות חלוקה בין כרטיסים באמצעות הגדרת device_map אוטומטית.

אפשר להוריד את דרישות החומרה באופן משמעותי על ידי טעינה ב־8 ביט בעזרת bitsandbytes. אם אין לכם גישה לכרטיס מסך מתאים בענן או בתחנת עבודה ייעודית, משקל הקבצים שמגיע ל־36.7 ג'יגה־בייט יהפוך את זמן הטעינה וההסקה לאיטיים מדי לעבודה אינטראקטיבית.

from transformers import pipeline

pipe = pipeline("text-generation", model="google/flan-ul2")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולהפיץ אותו בתוך מוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗