GPT
R

roberta-base

קוד פתוח

FacebookAImit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • rust

בסיס חזק ומוכח למשימות סיווג וניתוח טקסט באנגלית. הוא מציע ייצוג דו כיווני מדויק בלי המשקל והסיבוך של מודלים ענקיים.

  • 125Mפרמטרים
  • 514טוקנים בהקשר
  • 2.6 GBמשקל הקבצים
  • 7,990,786הורדות בחודש

מה זה

זהו מודל מקודד של 125 מיליון פרמטרים שאומן בשיטת חיזוי מילים מוסתרות על 160 גיגה בייט של טקסט באנגלית. בשונה ממודלים שמייצרים טקסט מילה אחרי מילה, הוא קורא את המשפט כולו בבת אחת ולומד את ההקשר של כל מילה משני הכיוונים שלה. הוא רגיש לאותיות גדולות וקטנות, כך שהוא מבדיל למשל בין המילה english לבין English.

במבחני GLUE המודל הגיע לתוצאות גבוהות בסיווג ודמיון טקסטים, למשל 94.8 ב־SST-2 לזיהוי רגש ו־91.9 ב־QQP. הוא מתקשה יותר במשימות כמו CoLA שבודקת דקדוקיות לשונית ושם קיבל 63.6, או ב־RTE עם 78.7. המטרה העיקרית שלו היא לשמש בסיס לכוונון עדין למשימות מוגדרות, ולא לעבודה כמודל עצמאי לפלט חופשי.

מתאים ל

  • סיווג טקסטים באנגלית

    בסיס מעולה לכוונון עדין למשימות של ניתוח סנטימנט, זיהוי נושאים וסינון תוכן קצר.

  • תיוג ישויות בטקסט

    בזכות הראייה הדו כיוונית והרגישות לאותיות גדולות, הוא מחלץ שמות ומונחים ביעילות.

  • חילוץ וקטורים לייצוג משפט

    הוא ממיר משפטים באנגלית למספרים לצורך בדיקת דמיון סמנטי או חיפוש מהיר.

איפה זה נופל

הוא לא יודע לייצר טקסט, לנהל שיחה או להמשיך פסקאות, ואם אתם צריכים מחולל תוכן תצטרכו מודל אחר כמו GPT2. חלון ההקשר שלו מוגבל ל־514 טוקנים, מה שאומר שהוא לא מסוגל לקרוא מסמכים ארוכים ברצף בלי לחתוך אותם. בנוסף, הוא אומן על מידע גולמי ולא מסונן מהאינטרנט וספרים, ולכן הוא נושא הטיות ודעות קדומות שעלולות לעבור ישירות לכל מודל שתאמנו על גביו. הוא גם אומן על אנגלית בלבד, כך שלעברית הוא לא מתאים כלל.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. המודל אומן אך ורק על טקסטים באנגלית כמו ויקיפדיה האנגלית, ספרים וחדשות. הזנת טקסט בעברית תגרום לפירוק שגוי של הטוקנים ותוצאות לא שמישות.

האם אפשר להשתמש בו בתור צ'אטבוט?

לא. מדובר במודל שמנחש מילים מוסתרות ולא במודל שמייצר תשובות. לשיחות ויצירת תוכן עדיף לבחור במודלים מחוללים שנועדו לכך.

איך מריצים

המודל שוקל 2.6 גיגה בייט ומכיל 12 שכבות, כך שאין שום בעיה להריץ אותו ישירות על מעבד מקומי רגיל או על כרטיס מסך פשוט וזול דרך ספריית transformers בפייתון. הוא נתמך גם ב־PyTorch וגם ב־TensorFlow.

בגודל כזה של 125 מיליון פרמטרים אין שום הצדקה כלכלית לשלם על קריאות ל־API חיצוני. כדאי להוריד אותו, לטעון אותו לזיכרון השרת שלכם ולהריץ עליו כוונון עדין או היקשים במחיר אפסי.

from transformers import pipeline

pipe = pipeline("fill-mask", model="FacebookAI/roberta-base")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT. מדובר ברישיון פתוח ומתירני שמאפשר להשתמש בו, לשנות אותו, לאמן עליו מודלים חדשים ולשלב אותו במוצרים מסחריים סגורים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗