GPT
N

nist-cybersecurity-training

קוד פתוח

ethanolivertroycc0-1.02025-10-13

  • cybersecurity
  • nist
  • compliance
  • security-controls
  • zero-trust

מאגר שיחות מובנה של חצי מיליון רשומות המבוסס על 596 פרסומי אבטחת מידע של NIST. הוא מיועד למי שרוצה לאמן מודל שמבין תקני ציות ואבטחה בלי לחתוך מסמכי PDF לבד.

  • 847הורדות בחודש
  • 58לייקים

מה זה

הנתונים חולצו מתוך 596 פרסומים רשמיים הכוללים תקני FIPS, דוחות פנימיים, סדרות SP 800 ו־1800, וניירות עמדה בתחום הסייבר דוגמת מסגרת CSF 2.0. החילוץ בוצע באמצעות Docling, והטקסט עובד למבנה של שיחת צ'אט עם הודעות מערכת, שאלות משתמש ותשובות עוזר המבוססות על המקורות. לכל רשומה מוצמדים מטא-דאטה עם שם המסמך, סוג התוכן ומזהה המקטע.

בסך הכל יש כאן 530,912 דוגמאות. הן מחולקות ל־263,252 פסקאות מתוך מסמכים, 136,320 מקטעים סמנטיים, 88,126 בקרות אבטחה מתוך SP 800-53, ועוד 43,214 הגדרות של מונחים טכניים. המאגר כולל חלוקה מובנית של 80 אחוז לאימון, שהם 424,729 רשומות בקובץ train.jsonl, ו־20 אחוז לאימות בקובץ valid.jsonl, שכולל 106,183 רשומות.

מתאים ל

  • אימון מודל ציות

    כוונון מודלי שפה למתן תשובות מדויקות על דרישות תקן SP 800-53 והגדרות אבטחה.

  • שליפה ליישומי RAG

    שימוש באינדקסי ה־FAISS המוכנים לבניית מנוע חיפוש סמנטי למסמכי NIST.

  • בוט הדרכה פנים-ארגוני

    מענה לשאלות מפתחים ואנשי אבטחה על ארכיטקטורת Zero Trust ותקני הצפנה.

איפה זה נופל

הטקסט כולו באנגלית ומתרכז ברגולציה אמריקאית פדרלית בלבד, ללא התאמה להנחיות ישראליות כמו אלו של מערך הסייבר הלאומי. בנוסף, תהליך הניקוי השמיט 72,698 קישורים שבורים שהיו במסמכים המקוריים ולא אומתו, כך שמידע שמסתמך על הפניות חיצוניות אלו נפגע. חלוקת המסמכים למקטעים קצרים עלולה גם לחתוך הקשר מהותי בהנחיות ארוכות ומורכבות, וצריך לבדוק שהתשובות אינן חלקיות לפני שמסתמכים עליהן באוטומציה של ציות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא CC0 1.0, מה שאומר שהנתונים הועברו לנחלת הכלל. אתם יכולים לאמן מודל ולמכור אותו או לשלב אותו במערכת סגורה בלי לחשוף קוד ובלי צורך במתן ייחוס.

האם יש במאגר תכנים בעברית?

לא. כל 596 הפרסומים מקורם ברגולציה האמריקאית ונכתבו במקור באנגלית בלבד. אם אתם רוצים מודל בעברית, תצטרכו לתרגם את הנתונים או להסתמך על יכולת התרגום של מודל הבסיס.

איך בנוי התוכן והאם הוא דורש עיבוד מוקדם?

הנתונים כבר מסודרים בתבנית שיחה עם חלוקה להודעות מערכת, משתמש ועוזר. לא צריך לחתוך PDF או לסדר פרומפטים, פשוט טוענים את train.jsonl ישירות לספריית אימון כמו MLX או Transformers.

מה ההבדל בין קובצי ה־JSONL לקובצי ה־FAISS וה־Parquet במאגר?

קובצי ה־JSONL מכילים את השיחות המלאות לאימון מודלים. קובצי ה־Parquet וה־FAISS כוללים וקטורים מוכנים שנוצרו בעזרת OpenAI, ונועדו למי שרוצה להקים מערכת שליפה מבוססת RAG בלי לייצר אמבדינגס מאפס.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של Hugging Face או בקריאת קובצי JSONL מקומית, ללא צורך באישור גישה. הנתונים מוכנים לאימון שיחה עם שדות messages ו־metadata. חוץ מקובצי הטקסט, המאגר מספק אמבדינגס מוכנים בפורמט Parquet שנוצרו עם text-embedding-3-small בווקטורים של 1536 ממדים, לצד אינדקסים מוכנים של FAISS לחיפוש דמיון. אורך התוכן הממוצע עומד על 539 תווים והחציון על 298 תווים, כך שמדובר במקטעים קצרים שלא דורשים חלונות הקשר גדולים מדי.

from datasets import load_dataset

ds = load_dataset("ethanolivertroy/nist-cybersecurity-training")

הרישיון

הרישיון הוא CC0 1.0 Universal, כלומר נחלת הכלל ללא שום הגבלות. מותר להשתמש במידע למטרות מסחריות, לשנות אותו, לאמן עליו מודלים פנימיים או מסחריים, ואין חובה לתת קרדיט או לשתף את התוצרים באותו רישיון.

הרישיון המלא ב־Hugging Face ↗