GPT
S

SecureBERT

קוד פתוח

ehsanaghaeibigscience-openrail-m2022-10-07

  • transformers
  • pytorch
  • roberta
  • fill-mask
  • cybersecurity

זהו מודל שפה שמיועד כולו לטקסטים של אבטחת מידע וסייבר. הוא מזהה מונחים מקצועיים ומנתח דוחות אבטחה טוב יותר ממודלים כלליים.

  • 514טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 30,325הורדות בחודש
  • 70לייקים

מה זה

מדובר בהתאמה ייעודית של ארכיטקטורת RoBERTa, שאומנה על כמות גדולה של טקסטים בתחום הסייבר ממקורות רשת שונים. המטרה העיקרית שלו היא לשמש בסיס למשימות עיבוד שפה בעולם האבטחה, כמו חילוץ ישויות של נוזקות, סיווג דוחות מודיעין איומים או מענה לשאלות מתוך תיעוד טכני.

לפי המפתחים, הוא מציג ביצועים טובים יותר ממודלים כמו RoBERTa הרגיל, SciBERT ואפילו SecBERT במשימות של השלמת מילים חסרות בטקסט אבטחתי. היתרון כאן הוא השילוב בין הבנה של ז'רגון מקצועי לבין שימור היכולת לנתח אנגלית כללית, בלי לאבד את ההקשר הדקדוקי הבסיסי.

מתאים ל

  • סיווג דוחות איומים

    הבנת מושגי סייבר מורכבים בטקסט חופשי וסיווג אוטומטי של דוחות מודיעין.

  • חילוץ ישויות אבטחה

    זיהוי שמות נוזקות, פגיעויות וקבוצות תקיפה מתוך פוסטים ומאמרי מחקר.

  • מענה לשאלות טכניות

    בסיס למערכת ששולפת תשובות מתוך תיעוד אבטחה ארגוני פנימי.

איפה זה נופל

האימון התבסס על מידע שנאסף מהרשת, מה שאומר שהוא עלול להכיל מינוחים ישנים, אי דיוקים או הטיות שנפוצות בפורומים. עולם הסייבר משתנה מהר, ומודל שלא עובר עדכון שוטף לא יכיר וקטורי תקיפה חדשים לחלוטין. היוצרים מזהירים במפורש שהתוצאות שלו אינן מהוות סמכות מקצועית, ואסור להסתמך עליו לקבלת החלטות מבצעיות בלי עין של מומחה אבטחה.

שאלות
נפוצות

האם המודל יודע לנתח דוחות סייבר בעברית?

לא. המודל אומן על אנגלית בלבד. אם תזינו לו טקסט בעברית הוא לא יבין את ההקשר ויוציא פלטים משובשים, כך שחייבים לתרגם את המידע קודם לכן.

האם הוא יכול להחליף אנליסט SOC?

בשום אופן לא. המודל יודע לעזור בניתוח טקסטואלי וזיהוי מונחים, אך הוא אינו מקבל החלטות ואינו מודע לאיומים חדשים שנוצרו אחרי אימונו. חובה שמומחה אנושי יבדוק את הפלטים שלו.

איך מריצים

המודל שוקל 1.4 גיגה בייט בלבד, כך שלא צריך שרת מפלצתי בשביל להריץ אותו. אפשר להעלות אותו ישירות דרך ספריית transformers על מחשב פיתוח רגיל או על מעבד גרפי פשוט, ואפילו על מעבד מרכזי הוא יעבוד בקצב סביר למשימות נקודתיות.

הוא מיועד להרצה עצמית ולא דורש קריאות לשרתים חיצוניים. אם אתם עובדים בסביבה סגורה של ארגון ביטחוני או פיננסי, עדיף בהחלט להוריד את הקבצים ולעבוד מקומית במקום להוציא טקסטים רגישים דרך API חיצוני.

from transformers import pipeline

pipe = pipeline("fill-mask", model="ehsanaghaei/SecureBERT")
print(pipe("שלום"))

הרישיון

הרישיון הוא bigscience-openrail-m, שמתיר שימוש מסחרי ומחקר חופשי, אבל כפוף למגבלות שימוש אחראי. אסור להשתמש בו לייצור קוד זדוני, לטקטיקות תקיפה או לפעולות שמפרות חוק. למוצר פנימי שמנתח איומים הוא מתאים, כל עוד עומדים בתנאי השימוש ההוגן.

הרישיון המלא בעמוד המודל ↗