GPT
R

raid

קוד פתוח

liamduganmit2024-09-02

מעל עשרה מיליון מסמכים שנועדו לבחון גלאי טקסט שנוצר בידי בינה מלאכותית. המאגר מציג כיסוי של 11 מודלים שונים, 11 סגנונות כתיבה ומתקפות אדברסריות שמנסות לעקוף זיהוי.

  • 6,013הורדות בחודש
  • 27לייקים

מה זה

המאגר כולל טקסטים שמיועדים לסיווג טקסט, במטרה לבדוק אם מדובר בתוכן אנושי או כזה שנכתב בידי מכונה. הוא מכיל מעל עשרה מיליון מסמכים שנבנו תוך שימוש ב־11 מודלי שפה שונים, ארבע אסטרטגיות דגימה, ו־12 סוגי מתקפות אדברסריות שנועדו לשבש את הזיהוי.

הנתונים מחולקים לשלושה חלקים עיקריים בקובצי CSV. החלק הראשון הוא האימון שכולל תוויות ומכסה תחומים כמו חדשות, ספרים, מאמרים, ביקורות, רדיט, מתכונים, ויקיפדיה ושירה, במשקל שמגיע לכמעט 12 גיגה בייט עם ההתקפות. חלק הבדיקה כולל את אותם התחומים אך מגיע ללא תוויות. החלק הנוסף, המכונה אקסטרה, מכיל תוויות ומיועד לתחומים של קוד ולשפות צ׳כית וגרמנית.

מתאים ל

  • בדיקת חוסן לגלאי תוכן

    בחינת עמידות של מודלי זיהוי מול 12 סוגי התקפות שנועדו להערים על אלגוריתמים.

  • אימון מסווג טקסט

    לימוד מודלים להבדיל בין טקסט שנכתב בידי אדם לבין טקסט מ־11 מודלי שפה.

  • מחקר על סגנונות גנרציה

    השוואה בין ארבע אסטרטגיות דגימה שונות של מודלים וההשפעה שלהן על פלט התוכן.

איפה זה נופל

אם אתם בונים גלאי לשוק המקומי, המאגר לא יעזור לכם בכלל כי אין בו עברית. השפות היחידות שנתמכות מלבד אנגלית הן צ׳כית וגרמנית, וגם הן יושבות רק בחלק התוספות ולא באימון המרכזי. בנוסף, קובץ הבדיקה מגיע ללא תוויות, כך שאי אפשר להעריך עליו ביצועים באופן עצמאי ומקומי ללא גישה למערכת ההערכה החיצונית של יוצרי הפרויקט.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא, אין במאגר טקסטים בעברית. השפות הזמינות הן אנגלית בחלק המרכזי, וצ׳כית וגרמנית בחלק ההרחבה. אם המטרה היא זיהוי טקסט בעברית, המאגר הזה לא יתאים למשימה.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר פורסם תחת רישיון MIT. הרישיון מאפשר שימוש מסחרי מלא, כולל אימון מודלים למוצרים סגורים. הדרישה היחידה היא שמירה על תנאי הרישיון ומתן קרדיט ליוצרים.

כמה מקום המאגר תופס בדיסק?

הנפח משתנה בהתאם לחלקים שתורידו. קובץ האימון שוקל 802 מגה בייט ללא מתקפות ומגיע ל־11.8 גיגה בייט עם הדוגמאות האדברסריות. יחד עם קובצי הבדיקה והתוספות, הנפח הכולל מגיע לקרוב ל־17 גיגה בייט.

מדוע אי אפשר לבדוק דיוק ישירות על קובץ הבדיקה?

קובץ הבדיקה מפורסם בכוונה ללא תוויות הסיווג. החוקרים עשו זאת כדי למנוע דליפת מידע ולאפשר תחרות והערכה הוגנת. כדי לבצע בדיקה עצמאית מלאה, תצטרכו להקצות חלק מקובץ האימון.

איך טוענים

טוענים את המאגר ישירות בספריית datasets של פייתון בפקודה load_dataset עם המזהה liamdugan/raid. אין צורך באישור גישה מיוחד כדי להוריד אותו.

הנתונים מאוחסנים בקובצי CSV פשוטים, אך נפח ההורדה כולל כמה גיגה בייטים טובים, במיוחד אם מורידים את כל החלקים יחד עם הדוגמאות האדברסריות. שימו לב לחלוקות השונות, מאחר שחלק המבחן מגיע ללא תוויות כלל.

from datasets import load_dataset

ds = load_dataset("liamdugan/raid")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי, הפצה ושילוב במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית. המודלים שתאמנו עליו אינם מחויבים ברישיון פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗