GPT
O

openai-detector

רץ בדפדפן

openaiרישיון לא דווח2023-01-05

  • docker

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

בודקים טקסט כדי לראות אם הוא נכתב בידי מכונה או אדם. הפתרון מיועד לחוקרים שרוצים לבחון ספציפית פלטים שמגיעים ממשפחת המודלים של GPT-2.

  • הורדות בחודש
  • 111לייקים

מה זה

מזינים קטע טקסט ובודקים את הסבירות שהוא נוצר על ידי מחשב. מאחורי הקלעים רצים המודלים RoBERTa-base או RoBERTa-large של פייסבוק, שאומנו על בסיס נתונים של טקסטים אנושיים מ־WebText מול מאות אלפי פלטים של גרסאות GPT-2 השונות.

לפי התיעוד, האימון התבסס על 250 אלף דגימות לכל גודל מודל, כולל טקסטים שנוצרו עם חיתוך Top-K 40 וכאלה שנוצרו ללא חיתוך. רמת הדיוק מגיעה לאזור אמצע שנות התשעים עבור פלטים עם Top-K 40, ויורדת לטווח שבין אמצע השבעים לסוף השמונים עבור דגימות אקראיות, תלוי בגודל המודל שיצר אותן.

מתאים ל

  • בדיקת פלטים של GPT-2

    זיהוי טקסטים שנכתבו בידי גרסאות שונות של GPT-2 על בסיס מודל RoBERTa.

  • מחקר על עקיפת גלאים

    בחינת היכולת של טקסט שעבר כוונון עדין לחמוק מזיהוי אוטומטי.

  • השוואת דיוק לפי פרמטרים

    בדיקת ההבדלים בדיוק הזיהוי בין דגימות אקראיות לפלטים שנוצרו בשיטת Top-K 40.

איפה זה נופל

הכלי נבנה ונבדק מול GPT-2 בלבד, כך שלא הייתי מסתמך עליו לזיהוי טקסטים של מודלים מודרניים יותר. בנוסף, בתיעוד עצמו מצוין שקל יחסית לחמוק מהזיהוי אם מבצעים כוונון עדין למודל המייצר, כמו למשל במאגר ביקורות האמזון שנבדק, כך שהתוצאה רחוקה מלהיות חסינה.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה כרגע?

לא. האפליקציה מוגדרת במצב מושהה, ולכן אי אפשר להריץ דרכה טקסטים ישירות כרגע.

איזה מודל בודק את הטקסט בפועל?

הבדיקה נשענת על RoBERTa-base או RoBERTa-large של פייסבוק. המודלים אומנו לזהות פלטים מול מאגר WebText של OpenAI.

האם הטקסטים שנשלחים נשמרים?

הרישיון ותנאי הפרטיות לא דווחו. לא מפורט בדף אם המידע נשמר בשרת או נמחק מיד לאחר העיבוד.

אפשר להריץ את זה מקומית?

הסביבה מבוססת על Docker ופורסם קוד בסיסי להורדת הנתונים. אם מורידים את המאגרים והמשקלים, אפשר להרים את המערכת לבד.

איך משתמשים

נכון לעכשיו אי אפשר להשתמש באפליקציה בדפדפן כי היא במצב מושהה. היא הוגדרה לרוץ בתוך Docker על חומרת cpu-upgrade, כך שגם כשהיא פועלת, הניתוח מתבצע על מעבד מרכזי ולא על כרטיס גרפי. לא מדווח על צורך בהרשמה או מגבלת תור ספציפית.

הרישיון

הרישיון של המרחב לא דווח. המשמעות היא שאין תנאי שימוש ברורים לשימוש חוזר בקוד, ולא מפורט מה המדיניות לגבי שמירת הטקסטים שמוזנים אליו.

הרישיון המלא ב־Hugging Face ↗