GPT
P

phishing-dataset

קוד פתוח

ealvaradobapache-2.02023-11-10

  • phishing
  • url
  • html
  • text

איחוד של ארבעה מקורות פישינג לקובץ אחד שמכיל כתובות רשת, הודעות סמס, מיילים וקוד אתרים. מתאים למי שרוצה לאמן מסווג טקסט לזיהוי הונאות בלי לאסוף ולנקות נתונים מכמה מאגרים בעצמו.

  • 1,099הורדות בחודש
  • 63לייקים

מה זה

המאגר מאחד ארבעה מקורות שונים לכדי מבנה אחיד של שתי עמודות בלבד: טקסט ותווית בינארית של אפס ללגיטימי ואחד לפישינג. הנתונים כוללים מעל 18,000 מיילים ממאגר אנרון, כמעט 6,000 הודעות סמס שחולצו מתמונות ברשת באמצעות קוד פייתון, מעל 800,000 כתובות רשת ממקורות פתוחים שונים, ומדגם של עמודי אינטרנט הכוללים כתובת וקוד מקור.

במהלך ההכנה נוקו ערכים ריקים וכפילויות, ובוצע איזון בין המחלקות כדי למנוע הטיות. מאגר האתרים הוגבל לחיפוש של 30,000 דוגמאות ראשונות, ומשם נלקחו רק עמודים במשקל של פחות ממאה קילובייט כדי למנוע עומס בעיבוד.

במאגר תמצאו שתי גרסאות מאוחדות עיקריות. הגרסה המלאה כוללת את כל מאות אלפי כתובות הרשת, מה שיוצר מצב שבו כתובות מהוות 97 אחוז מהדאטה. הגרסה המצומצמת חותכת 95 אחוז מדגימות הכתובות כדי לאפשר ייצוג הוגן יותר להודעות, למיילים ולקוד האתרים, והיא זו שמומלצת על ידי היוצר לאימון מודלים מבוססי שפה.

מתאים ל

  • אימון מסווגי הודעות זדוניות

    זיהוי ניסיונות הונאה בהודעות טקסט ובמיילים באנגלית באמצעות מודלים כמו ברט.

  • סינון כתובות אינטרנט חשודות

    אימון מודל קל משקל לבדיקת כתובות רשת חשודות עוד לפני שלב פתיחת הדפדפן.

  • בדיקת חוסן למסווגי טקסט

    בחינת יכולת ההכללה של מודל קיים מול סוגי קלט מגוונים שנעים בין קוד להודעה.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על מקורות ישנים, כולל תכתובות מייל של חברת אנרון שכבר רחוקות מסגנון התקיפות של ימינו. אין כאן מילה אחת בעברית, ולכן המאגר לא יעזור לזיהוי פישינג מקומי המכוון לישראלים ללא תרגום או איסוף עצמאי.

איחוד סוגי מדיה שונים לעמודת טקסט אחת מייצר אתגר. קוד מקור של אתר אינטרנט נראה ומתנהג אחרת לחלוטין מכתובת מקוצרת או מהודעת סמס קצרה, מה שעלול לבלבל מסווג שלא מתוכנן להתמודד עם פערי אורך ומבנה כה קיצוניים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון אפאצ'י שתיים אפס מתיר שימוש מסחרי מלא כולל שילוב במוצרים סגורים. תצטרכו רק לכלול את הצהרת זכויות היוצרים והרישיון המקורי בקוד או בתיעוד ההפצה שלכם. אין דרישה לפתוח את הקוד של המוצר שפיתחתם.

האם המאגר כולל דוגמאות בעברית?

לא, כל הנתונים במאגר מוגדרים ומבוססים על השפה האנגלית בלבד. הודעות הסמס, המיילים ודפי האתרים נאספו ממקורות גלובליים ואינם משקפים תבניות הונאה ישראליות. שימוש במודל עבור משתמשים בישראל ידרוש איסוף נתונים מקומיים בנפרד.

מדוע נוצרה גרסה מצומצמת לצד הגרסה המלאה?

בגרסה המלאה קיימות מעל 800,000 כתובות אינטרנט, שמהוות כמעט 97 אחוז מכלל הרשומות במאגר. חוסר האיזון הזה גרם למודלים מבוססי שפה להיכשל בסיווג סוגי הקלט האחרים. הגרסה המצומצמת חותכת את רוב הכתובות כדי לאפשר משקל שווה יותר למיילים ולהודעות.

איך נאספו הודעות הסמס בדאטהסט?

החוקרים אספו תמונות של הודעות טקסט והודעות פישינג מתוך רשת האינטרנט. לאחר מכן הם חילצו את הטקסט מתוך התמונות באמצעות סקריפט ייעודי בפייתון. המאגר מכיל כמעט 6,000 הודעות כאלו המחולקות להודעות לגיטימיות והודעות הונאה.

איך טוענים

טוענים את הנתונים דרך ספריית הדאטהסטס של האגינג פייס בעזרת הפקודה הרגילה, תוך ציון שם החלק הרצוי והפעלת אישור להרצת קוד מרוחק. המאגר פתוח לציבור ואינו דורש הרשאות מיוחדות או אישור גישה.

כל הנתונים מגיעים תחת חלוקת אימון בודדת ללא פיצול מובנה לבדיקה. מי שרוצה להעריך את המודל בצורה תקינה יצטרך לפצל את המידע ידנית בעזרת ספריות כמו סקיקיט לורן. השדות היחידים לעבודה הם הטקסט הגולמי והתווית, ללא מטא נתונים נוספים.

from datasets import load_dataset

ds = load_dataset("ealvaradob/phishing-dataset")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשחרר את המוצר או המודל שלכם תחת אותו הרישיון. תנאי השימוש דורשים מתן קרדיט ושמירה על הודעות זכויות היוצרים המקוריות. המגבלה הזו חלה על הנתונים עצמם, אך מודל שאומן עליהם אינו מחויב ברישיון הקוד הפתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗