GPT
F

flan-t5-xxl

קוד פתוח

googleapache-2.02022-10-21

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

גרסת ענק של מודל קידוד ופענוח שאומנה על יותר מאלף משימות עם הוראות ישירות. מיועדת למי שרוצה ביצועי מענה לשאלות ותרגום בלי לאמן הכל מאפס.

  • 11Bפרמטרים
  • 167 GBמשקל הקבצים
  • 40,214הורדות בחודש
  • 1,287לייקים

מה זה

מדובר בגרסה הגדולה ביותר במשפחת המודלים הזו, עם מעל 11 מיליארד פרמטרים שמשתמשים במבנה קידוד ופענוח קלאסי של טקסט לטקסט. המפתחים לקחו את הבסיס המקורי ואימנו אותו מחדש על מעל אלף משימות שונות תוך שימוש בהוראות מפורשות. הגישה הזו מאפשרת למודל להבין פקודות ישירות כמו תרגום או מענה על שאלות בלי צורך בהתאמה מיוחדת לכל משימה.

התוצאות במחקר מראות שהכוונון הזה מצליח להתחרות במודלים גדולים בהרבה שלא עברו אימון הוראות דומה, כולל מודלים של עשרות מיליארדי פרמטרים. היכולת שלו לעבוד מיד מתוך הקשר קצר חוסכת את הצורך בכמויות גדולות של דוגמאות בזמן הפנייה.

מתאים ל

  • מענה לשאלות מתוך טקסט

    הוא מיומן מאוד בחילוץ מידע והבנת שאלות ישירות באנגלית בלי צורך באימון מקדים.

  • תרגום בין שפות אירופיות

    האימון כולל תמיכה מובנית בתרגום בין אנגלית, גרמנית, צרפתית ורומנית.

  • מחקר על הסקת מסקנות

    מתאים לבדיקת יכולות הבנה והיגיון במשימות שמנוסחות כהוראה ישירה.

איפה זה נופל

החוקרים מודים במפורש שהמודל אומן על מאגר נתונים עצום שלא עבר סינון לתוכן בוטה או הטיות, ולכן הוא מסוגל לפלוט תוכן פוגעני או לשחזר הטיות קיימות. בנוסף, הוא לא נבדק בסביבות ייצור אמיתיות אלא בעיקר במבחני מחקר, כך שאין שום הבטחה לגבי יציבות בעולם האמיתי. תמיכת השפות מתמקדת בעיקר באנגלית, צרפתית, גרמנית ורומנית, כך שלמשימות בעברית הוא כנראה לא יתאים כלל.

שאלות
נפוצות

האם המודל תומך בעברית?

כרטיס המודל מפרט אנגלית, גרמנית, צרפתית ורומנית בלבד. הוא לא מיועד לעבודה בעברית ולא כדאי להסתמך עליו למשימות בשפה זו.

מה צריך כדי להריץ אותו על גבי מחשב יחיד?

המשקלים המקוריים תופסים 167 גיגה בייט בדיוק מלא, לכן אי אפשר להריץ אותו על כרטיס בודד בלי להשתמש בהרצה בדיוק מופחת כמו שמונה ביט או חלוקה לכמה כרטיסים.

איך מריצים

כדי להריץ אותו צריך משאבים רציניים. קבצי המשקלים לבדם שוקלים 167 גיגה בייט בגלל דיוק מלא, מה שאומר שהורדה וטעינה רגילה יחנקו כל שרת מקומי בסיסי. הרצה על מעבד רגיל מופיעה בדוגמאות הקוד אבל בפועל תהיה איטית מדי לכל צורך מעשי.

בסביבת עבודה אמיתית חובה לפרוס אותו על מעבדים גרפיים חזקים באמצעות ספריות שמחלקות את הזיכרון, או לכווץ את הדיוק לחצי או שמונה ביט. אם אין לכם תשתית ענן ייעודית עם כרטיסי מסך עתירי זיכרון, עדיף להשתמש בנקודת קצה מנוהלת.

from transformers import pipeline

pipe = pipeline("text-generation", model="google/flan-t5-xxl")
print(pipe("שלום"))

הרישיון

הרישיון הוא אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו בתוך מוצרים סגורים. התנאים דורשים בעיקר שימור של הודעות זכויות היוצרים והרישיון המקורי, בלי לגרור חובות שיתוף קוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗