GPT
R

roberta-large

קוד פתוח

FacebookAImit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • onnx

מודל דו כיווני עם 355 מיליון פרמטרים שמתמחה בהבנת טקסט באנגלית. בוחרים בו כשצריכים בסיס חזק לסיווג או שליפת מאפיינים במקום לייצר טקסט חדש.

  • 355Mפרמטרים
  • 514טוקנים בהקשר
  • 7.0 GBמשקל הקבצים
  • 6,070,471הורדות בחודש

מה זה

הארכיטקטורה נשענת על 24 שכבות של מקודד בלבד ומאומנת על חיזוי מילים מוסתרות בתוך משפט. בניגוד למודלים שמנחשים רק את המילה הבאה, כאן המבנה לוקח בחשבון את ההקשר משני הצדדים בו זמנית. האימון התבצע על 160 גיגה בייט של טקסטים שכללו חדשות, ספרים וויקיפדיה באנגלית, עם מיסוך דינמי שהשתנה בכל מעבר על המידע.

במבחני GLUE המודל הגיע לתוצאות גבוהות מאוד אחרי התאמה ייעודית, כמו 96.4 בסיווג סנטימנט ב־SST-2 ודמיון סמנטי ב־STS-B, לצד 90.2 במשימת הסקת מסקנות ב־MNLI. המשמעות בשטח היא יכולת הבנה עמוקה של קשרים תחביריים ומשמעויות מורכבות, מה שהופך אותו לנקודת מוצא אמינה למשימות סיווג וניתוח שפה.

מתאים ל

  • סיווג טקסטים באנגלית

    אימון שכבת פלט דקה מעל המודל לזיהוי נושאים, סנטימנט או כוונות משתמש בדיוק גבוה.

  • חילוץ וקטורים להשוואה

    הפקת ייצוגים מתמטיים של משפטים שלמים עבור בדיקת דמיון סמנטי או חיפוש חכם.

  • השלמת מילים מוסתרות

    בדיקת התאמה של מונחים בתוך משפטים קיימים על בסיס ההקשר המלא משני הצדדים.

איפה זה נופל

זה לא מודל שכותב תשובות, מייצר שיחות או משלים טקסט חופשי. כל ניסיון לבקש ממנו לפעול כמו מודל שיחה ייכשל, כי הוא יודע רק לנחש טוקנים מוסתרים בתוך חלון של 514 טוקנים. בנוסף, הוא אומן אך ורק באנגלית ורגיש לאותיות גדולות וקטנות. אם הטקסט שלכם כולל עברית, הוא פשוט לא יידע מה לעשות איתו. נתוני האימון נאספו מהרשת ללא סינון ידני של תוכן, והכרטיס מבהיר במפורש שהתוצאות עלולות לכלול הטיות קיימות שעוברות הלאה לכל מודל שתאמנו עליו.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן אך ורק על מאגרי טקסט באנגלית, ואוצר המילים שלו לא כולל תמיכה בשפות אחרות. כדי לעבוד בעברית תצטרכו לחפש מודלים ייעודיים לשפה או גרסאות רב לשוניות.

האם הוא יכול לשמש כצ'אטבוט?

לא, המבנה שלו מבוסס על מקודד בלבד ולא על מחולל טקסט. הוא מקבל משפט שלם ומנתח אותו, ולא מייצר מילים חדשות ברצף כמו מודלים שמיועדים לשיחה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־7.0 גיגה בייט, כך שצריך כרטיס מסך עם לפחות 8 עד 12 גיגה בייט של זיכרון כדי להריץ הסקת מסקנות בצורה חלקה, ויותר מזה אם רוצים לאמן שכבות עליונות. המודל רץ ישירות דרך ספריית transformers ב־PyTorch או TensorFlow עם תמיכה מלאה בהסתרת טוקנים וחילוץ וקטורים.

אם אתם צריכים רק לבדוק התאמה לכמה עשרות דוגמאות ביום, עדיף להשתמש בנקודת קצה מנוהלת בענן כדי לא לתחזק שרת. לעומת זאת, אם יש לכם זרם קבוע של מסמכים לסיווג, הרצה מקומית על שרת ייעודי תהיה הרבה יותר כלכלית ותמנע זמני השהיה ברשת.

from transformers import pipeline

pipe = pipeline("fill-mask", model="FacebookAI/roberta-large")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים זמינים תחת רישיון MIT. מותר להשתמש בהם בפרויקטים מסחריים, לשנות אותם, לאמן אותם מחדש ולהפיץ אותם בתוך מוצר סגור. התנאי היחיד הוא שמירת הודעת זכויות היוצרים וכתב הוויתור על האחריות של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗