GPT
D

distilroberta-base

קוד פתוח

distilbertapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • rust

גרסה מכווצת ומהירה של רוברטה שמיועדת למשימות הבנה וסיווג באנגלית. היא חותכת את משאבי הריצה בחצי בלי להקריב הרבה מהדיוק.

  • 83Mפרמטרים
  • 514טוקנים בהקשר
  • 1.8 GBמשקל הקבצים
  • 1,435,012הורדות בחודש

מה זה

זהו עיבוד מזוקק של RoBERTa-base שמכיל 82 מיליון פרמטרים ושישה בלוקים של טרנספורמר, במקום 125 מיליון במקור. המטרה העיקרית פה היא מהירות. לפי הנתונים הוא רץ בממוצע פי שניים יותר מהר מרוברטה הרגילה, תוך שמירה על רגישות לאותיות גדולות וקטנות באנגלית.

הוא אומן על קורפוס OpenWebText, שהוא שחזור של WebText אבל בערך רבע מכמות המידע ששימשה לאימון מודל המקור. בבדיקות GLUE הוא עדיין שומר על ציונים יפים, למשל 92.5 ב־SST-2 לניתוח סנטימנט ו־90.8 ב־QNLI. לעומת זאת, במשימות שדורשות הבנה דקדוקית עדינה כמו CoLA הוא נעצר ב־59.3, כך שהדיוק הלשוני המורכב נפגע מהזיקוק.

מתאים ל

  • סיווג טקסטים מהיר

    אימון שכבת סיווג עליונה לזיהוי כוונות או ניתוח רגש באנגלית, כשזמן התגובה של השרת קריטי.

  • חילוץ ישויות ותיוג

    ביצוע token classification על מסמכים קצרים באנגלית עם חומרה מינימלית בלי לחנוק את הזיכרון.

  • מילוי מילים חסרות

    שימוש ישיר בארכיטקטורת fill-mask לבדיקת השלמות של טוקנים בתוך משפטים נתונים באנגלית.

איפה זה נופל

הוא יודע רק אנגלית, ואין לו שום מושג מה לעשות עם עברית. הוא מוגבל לחלון של 514 טוקנים, כך שטקסטים ארוכים ייחתכו. בנוסף, הוא מיועד למשימות של פענוח והבנת משפטים קיימים ולא לג'נרוט טקסט חופשי. הכרטיס מזהיר במפורש שהפלט עלול להכיל הטיות וסטריאוטיפים פוגעניים שהועתקו מהאינטרנט, ושהוא לא מאומן לייצג עובדות היסטוריות או מציאותיות.

שאלות
נפוצות

האם אפשר להשתמש בו לצ'אטבוט או ליצירת טקסט חדש?

לא, הוא מבוסס על מבנה של קידוד בלבד ומיועד למשימות הבנה וסיווג. אם אתם צריכים מחולל טקסט, תעברו למודלים מסוג GPT2.

כמה הוא מפסיד בביצועים לעומת RoBERTa המקורי?

במשימות סיווג נפוצות ההבדל זניח, והוא מגיע לתוצאות קרובות מאוד כמו 92.5 בסנטימנט. במשימות דקדוק עדינות יותר הפער נפתח לרעתו, אבל מרוויחים מהירות כפולה בחצי מהמשאבים.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון למשימת fill-mask, או מעמיסים עליו ראש סיווג משלכם. עם קבצים במשקל 1.8 גיגה בייט בלבד, לא צריך פה כרטיסי מסך כבדים. מעבד רגיל יספיק לרוב משימות ההסקה, וכרטיס מסך פשוט יריץ תהליכי fine-tuning קצרים במהירות גבוהה.

בגלל המשקל הקל וזמני התגובה המהירים, אין שום סיבה להישען על שירות ענן חיצוני או לשלם על קריאות רשת. מרימים אותו מקומית בתוך הקונטיינר של השירות שלכם וחוסכים השהיות של תקשורת.

from transformers import pipeline

pipe = pipeline("fill-mask", model="distilbert/distilroberta-base")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, להפיץ עותקים ולסגור את הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין כאן הגבלות שימוש מוזרות שמונעות שילוב במערכות ייצור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗