GPT
S

sms_spam

קוד פתוח

ucirvineunknown2022-03-02

המאגר כולל הודעות סמס אמיתיות באנגלית שמתוייגות כספאם או כהודעות לגיטימיות. הוא מתאים למי שרוצה לאמן או לבדוק מודל סיווג טקסט פשוט ומהיר על הודעות קצרות בלי להתעסק בניקוי מורכב.

  • 4,673הורדות בחודש
  • 57לייקים

מה זה

מדובר באוסף שמכיל 5,574 הודעות סמס אמיתיות שנאספו במקור עבור מחקר על סינון ספאם בטלפונים ניידים. הנתונים מבוססים על מאמר אקדמי משנת 2011 של החוקרים אלמיידה, גומז הידלגו ויאמקאמי, והועלו למאגר של UCI. המבנה שלו ישיר לחלוטין. כל רשומה מורכבת מטקסט ההודעה ומתגית סיווג אחת בלבד, שמציינת אם מדובר בספאם או בהודעה רגילה, מה שמכונה ham.

הטקסטים שמורים בצורה גולמית ולא מקודדת, כפי שנשלחו במקור על ידי משתמשים באנגלית. כרטיס המאגר הנוכחי לא מפרט תהליכי סינון מיוחדים, לא חושף מי בדיוק האנשים שכתבו או תייגו את ההודעות, ומשאיר את רוב השדות הטכניים על תהליך האיסוף ריקים. בנוסף, אין כאן חלוקה מובנית לחלקי אימון, בדיקה או ולידציה, כך שתצטרכו לפצל את הנתונים בעצמכם בהתאם לצרכים של הפרויקט שלכם.

מתאים ל

  • אימון מסווג ספאם בסיסי

    בניית מודל קלאסי לסיווג הודעות טקסט קצרות באנגלית כספאם או תוכן לגיטימי.

  • הערכת ביצועי מודלי שפה

    בדיקת יכולת ההכללה והדיוק של מודל סיווג קיים מול דוגמאות היסטוריות.

  • תרגול משימות סיווג טקסט

    שימוש בנתונים פשוטים ולא מקודדים לצורך לימוד או ניסוי מהיר של אלגוריתמים.

איפה זה נופל

הנתונים פורסמו במקור במאמר מ 2011, כך שהם בני יותר מעשור ומשקפים את האופן שבו ספאם בסמס נראה ונכתב באותה תקופה. כל ההודעות הן באנגלית בלבד, ואין כאן אף דוגמה בעברית או תמיכה בפורמטים מודרניים של הונאות ברשתות. בנוסף, הכרטיס לא מספק מידע על הטיות, פרטיות או הסרת מידע מזהה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון המדווח הוא unknown ובכרטיס אין פרטי רישוי. במצב כזה אין אישור לשימוש מסחרי, ולא כדאי להכניס מודל שאומן עליו למוצר מסחרי ללא בירור מול המקור.

האם המאגר כולל הודעות בעברית?

לא. כל 5,574 ההודעות שנאספו הן באנגלית בלבד. אם המטרה היא לזהות הודעות ספאם בישראל, המאגר הזה לא יספק נתונים מתאימים.

כמה המאגר שוקל וכמה רשומות יש בו?

המאגר קטן מאוד ומכיל 5,574 הודעות סמס בקובץ parquet יחיד. הוא נטען כמעט מיד ולא דורש משאבי זיכרון מיוחדים.

איך נאספו ההודעות במקור?

הנתונים הגיעו ממחקר אקדמי משנת 2011 על סינון ספאם בטלפונים ניידים. כרטיס המאגר הנוכחי לא מפרט מעבר לכך את אופן האיסוף או הסינון.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה של Hugging Face בלי צורך בבקשת גישה או באישור מיוחד. הקבצים שמורים בפורמט parquet לצד קובץ התיעוד, והנפח הכולל קטן מאוד בהתחשב בכך שיש בו כמה אלפי רשומות בלבד. שני השדות היחידים שקיימים בפנים הם sms שמכיל את תוכן ההודעה, ו label שמחזיק את הסיווג.

from datasets import load_dataset

ds = load_dataset("ucirvine/sms_spam")

הרישיון

הרישיון מוגדר כלא ידוע, וכרטיס המאגר לא מספק שום פירוט לגבי תנאי השימוש. המשמעות ברורה. אסור להניח שמותר להשתמש בו לצרכים מסחריים או לשלב אותו במוצר חי, כי אין שום הגנה משפטית לגבי זכויות היוצרים על הטקסטים שנאספו.

הרישיון המלא ב־Hugging Face ↗