GPT
R

roberta-base-openai-detector

קוד פתוח

openai-communitymit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

זה מסווג קל משקל שבודק אם טקסט נכתב בידי מודל שפה ישן, ספציפית הדור של GPT-2. הוא שימושי בעיקר למחקר היסטורי על טקסט סינתטי או כבסיס לניסויי זיהוי מקומיים.

  • 125Mפרמטרים
  • 514טוקנים בהקשר
  • 1.9 GBמשקל הקבצים
  • 115,455הורדות בחודש

מה זה

מדובר במודל RoBERTa base שעבר כוונון עדין על פלטים של GPT-2 בגרסת 1.5B מול טקסטים אנושיים ממאגר WebText. התפקיד שלו הוא לקבל קטע טקסט באנגלית ולהחזיר תחזית בינארית פשוטה: האם המקור הוא אדם או מכונה.

בבדיקות של המפתחים על דגימות באורך 510 טוקנים, הוא הגיע לכ־95 אחוזי דיוק מול תוכן של GPT-2. המספר הזה נשמע גבוה, אבל במבחן המציאות הוא תלוי מאוד בשיטת הדגימה שבה נוצר הטקסט המקורי. למשל, טקסטים שנוצרו בשיטת nucleus sampling היו הקשים ביותר לסיווג, אף שאימון עליהם שיפר את העמידות לשיטות אחרות.

מתאים ל

  • מחקר על טקסט סינתטי

    מתאים לניתוח ביצועים של מסווגים ישנים מול פלטים שמקורם במודלים מסוג GPT-2.

  • סינון בסיסי של ספאם ישן

    מספק בדיקה מקומית מהירה וזולה לזיהוי תוכן מיוצר אוטומטית שנוצר בכלים ישנים.

  • בנצ'מרק להשוואת גלאים

    משמש כנקודת ייחוס היסטורית לבדיקת יעילות של גלאי תוכן חדשים יותר.

איפה זה נופל

הוא לא מתאים לזיהוי טקסטים שנכתבו על ידי מודלים מודרניים כמו ChatGPT, והמפתחים מציינים במפורש שהוא עלול לתת תוצאות שגויות מולם. מעבר לכך, דיוק של 95 אחוזים אומר שגיאה אחת מכל עשרים מקרים, ולכן אסור להסתמך עליו לבד להאשמות בהעתקות או לקבלת החלטות אוטומטיות. הוא מוגבל לאנגלית בלבד, רגיש לחלון של 514 טוקנים, והביצועים שלו צונחים ככל שמודל המקור גדול או שונה ממה שהוגדר באימון המקורי.

שאלות
נפוצות

האם הוא מזהה תוכן שנכתב בעברית?

לא. המודל אומן על נתונים באנגלית בלבד. הרצה שלו על טקסט בעברית תניב תוצאות חסרות משמעות לחלוטין.

האם כדאי להשתמש בו לבדיקת עבודות סטודנטים?

בשום אופן לא. המודל אומן על GPT-2 ולא מכיר מודלים עדכניים, מה שיוביל לטעויות רבות ולזיהוי שגוי של כותבים אנושיים.

איך מריצים

בזכות גודל של 125 מיליון פרמטרים ומשקל קבצים של 1.9 גיגה בייט, אפשר להריץ אותו כמעט בכל מקום. כל מעבד מודרני ממוצע מריץ אותו בלי להזיע עם ספריית transformers, וכרטיס מסך פשוט ייתן מהירות גבוהה במיוחד בסריקת כמויות טקסט.

ההרצה המקומית פשוטה כל כך שאין שום סיבה לחפש שירות ענן או לשלם על API חיצוני. טוענים אותו כ־pipeline של text-classification בכמה שורות פייתון ומקבלים סיווג מיידי אצלכם במכונה, בלי תלויות חיצוניות ובלי עלויות שוטפות.

from transformers import pipeline

pipe = pipeline("text-classification", model="openai-community/roberta-base-openai-detector")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו בתוך מוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗