GPT
S

SecBERT

קוד פתוח

jackadumaapache-2.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • bert
  • fill-mask

מודל שפה קטן שאומן על טקסטים של אבטחת מידע ודוחות תקיפה. הוא מתאים למי שרוצה בסיס ייעודי למשימות עיבוד שפה בעולמות הסייבר.

  • 84Mפרמטרים
  • 514טוקנים בהקשר
  • 642 MBמשקל הקבצים
  • 75,924הורדות בחודש

מה זה

במקום לקחת מודל כללי שלא מכיר מונחים של תקיפות, כאן אימנו ארכיטקטורת BERT על מאגרי מידע טכניים כמו דוחות APTnotes, נתוני Stucco, פרויקט CASIE ומשימת SemEval-2018. בנוסף אימנו לו אוצר מילים ייעודי בשם secvocab, כך ששמות של נוזקות או טכניקות לא מתפרקים לרצף חסר היגיון.

המודל מגיע עם 84 מיליון פרמטרים ושישה שכבות בלבד. המטרה העיקרית שלו בכרטיס היא השלמת מילים חסרות (fill-mask), כשהרעיון הוא לקחת אותו כבסיס ולאמן אותו הלאה למשימות כמו זיהוי ישויות (NER) בדוחות אבטחה, סיווג טקסטים של תקריות או מענה לשאלות בתחום.

מתאים ל

  • זיהוי שמות נוזקות בדוחות

    בסיס לכוונון מודל זיהוי ישויות (NER) שמסמן שמות תוקפים ונוזקות בתוך טקסט טכני באנגלית.

  • סיווג דיווחי תקריות סייבר

    מיון ראשוני של דוחות מודיעין לפי נושאים בעזרת אימון שכבת סיווג מעל הייצוגים שלו.

  • השלמת מונחי אבטחה בטקסט

    השלמת מילים חסרות בתוך משפטים טכניים באנגלית על בסיס אוצר המילים הייעודי לתחום.

איפה זה נופל

הוא אומן באנגלית בלבד ואין לו שום תמיכה בעברית. עם חלון הקשר של 514 טוקנים, אי אפשר לזרוק אליו דוח חקירה שלם באורך של עשרות עמודים, אלא תצטרכו לפרק את הטקסט לפסקאות קצרות.

הוא לא מודל שמחזיר תשובות מוכנות למשתמש כמו צ'אטבוט. מדובר במודל masked language ישן שפורסם ב־2022, והוא דורש מכם עבודת כוונון (fine-tuning) למשימה הספציפית שלכם כדי לקבל תוצאות שמישות בפועל.

שאלות
נפוצות

האם אפשר להשתמש בו לניתוח לוגים או דוחות בעברית?

לא. המודל אומן על קורפוס באנגלית בלבד עם אוצר מילים ייעודי לאנגלית. הוא לא יבין טקסטים בעברית ולא יתאים למשימות מקומיות.

האם הוא יודע לענות על שאלות סייבר ישר מהקופסה?

לא, הוא מוגדר למשימת fill-mask בלבד של השלמת מילים. בשביל מענה לשאלות או סיווג צריך לקחת אותו ולאמן אותו ייעודית עם נתונים מתאימים.

איך מריצים

המשקל הכולל של הקבצים עומד על 642 מגה-בייט, כך שאפשר להריץ אותו כמעט על כל מעבד רגיל, לפטופ או שרת פשוט בלי לגעת במאיצי GPU כבדים. הוא נטען ישירות דרך ספריית transformers בפייתון לפעולת fill-mask בלי צורך בתשתית מורכבת.

בגודל הזה אין שום הצדקה לשלם על קריאות ל־API חיצוני או לסמוך על ספקים שיחזיקו אותו למעלה. מורידים את הקבצים ומריצים לוקאלית, במיוחד אם אתם מעבדים מידע רגיש של אבטחת מידע שלא רוצים שייצא מהרשת הפנימית. היוצרים הוציאו במקביל גם גרסת SecRoBERTa למי שמעדיף את הארכיטקטורה הזו.

from transformers import pipeline

pipe = pipeline("fill-mask", model="jackaduma/SecBERT")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 642 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 חופשי לגמרי. אתם יכולים להשתמש בו במוצרים מסחריים, לשנות את הקוד והמשקלים, ולסגור את המוצר שלכם בלי לפתוח את הקוד. התנאי היחיד הוא לשמור על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗