GPT
C

Cybersecurity-Dataset-Fenrir-v2.1

קוד פתוח

AlicanKiraz0apache-2.02025-10-06

  • cybersecurity
  • defensive-security
  • instruction-tuning

המאגר מרכז 99,870 שיחות להדרכת מודלים בהגנת סייבר. הוא מיועד למי שרוצה לאמן עוזר טכני שמסביר איך לתקן פרצות במקום לייצר אקספלויטים.

  • 3,852הורדות בחודש
  • 138לייקים

מה זה

הנתונים מורכבים משלשות שיחה של סיסטם, משתמש ועוזר ברמת מהנדס אבטחה בכיר. התוכן מתמקד במתודולוגיות הגנה מבוססות תקנים כמו OWASP, MITRE ATT&CK, NIST ו־CIS, לצד אבטחת ענן, DevSecOps והגנות מפני הזרקת פרומפטים.

תהליך הייצור התחיל מאיסוף של מעל 450 אלף מסמכים טכניים ציבוריים, כולל תקנים, מסמכי RFC והנחיות ספקים. לאחר מכן הטקסטים סוננו באמצעות מילות מפתח ושיקועים סמנטיים כדי להשאיר רק תכנים הגנתיים, ועברו סינתזה להוראות שיחה שכוללות תבניות סירוב מובנות לבקשות פוגעניות. בקרת האיכות כללה ניקוי כפילויות בשיטת MinHash, הסרת פרטים מזהים, סריקת הזיות ובדיקה ידנית מדגמית של כשלושה אחוזים מהרשומות. כל הנתונים יושבים בחלוקת אימון בודדת ללא פיצול מובנה למבחן.

מתאים ל

  • אימון עוזר אבטחה ארגוני

    כוונון עדין למודל שנותן המלצות הגנה, ניתוח כשלי קונפיגורציה והסבר על פערי אבטחה בקוד.

  • יישור מודלים למניעת ניצול

    הטמעת דוגמאות לסירוב בטוח ומנומק כשמשתמשים מבקשים לייצר כלי תקיפה או קוד זדוני.

  • מדריכי הקשחה לענן ו־CI/CD

    יצירת בוט שמספק צעדי הגנה מעשיים לניהול זהויות, קוברנטיס ואבטחת שרשרת אספקה.

איפה זה נופל

התוכן כולו באנגלית בלבד, כך שמי שבונה כלי לתחקור אירועים בעברית לא יקבל כאן מענה. יש פה גם הטיה מובהקת לתקנים בינלאומיים מסוימים כמו NIST ו־CIS, ללא כיסוי של דרישות רגולטוריות מקומיות או מסמכי ISO ו־GDPR. בנוסף, המאגר חד צדדי במכוון. הוא מיועד להגנה, וכשמבקשים ממנו לכתוב נוזקה או לבנות מתקפה הוא מחזיר סירוב מנומק. לא הייתי משתמש בזה לאימון כלי שצריך לדמות תוקף אדום, אלא רק למערכות שנועדו לחזק תצורות ולהדריך צוותי אבטחה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא Apache-2.0, שמאפשר שימוש מסחרי חופשי, כולל אימון מודלים פנימיים או מוצרים שנמכרים ללקוחות. התנאי העיקרי הוא שמירה על תנאי הרישיון ומתן ייחוס מתאים למחבר.

האם הדאטהסט מתאים למשימות בעברית?

לא. כל 99,870 הרשומות כתובות באנגלית בלבד. אם המטרה היא מענה בעברית, תצטרכו לתרגם את החומר או לאמן על מקורות מקומיים נוספים.

איך המידע נאסף והאם יש בו קוד זדוני?

היוצר אסף מעל 450 אלף מסמכים טכניים ציבוריים, תקנים ו־RFCs, וסינתז מהם שיחות הגנה. הנתונים סוננו כדי למנוע בניית אקספלויטים, כך שבמקום קוד תוקף תמצאו הסברים על חולשות ותבניות סירוב מובנות.

האם יש חלוקה מובנית לסט אימון ומבחן?

לא. המאגר מכיל פיצול יחיד שמוגדר במלואו כ־train. מי שרוצה להעריך ביצועים בצורה אמינה יצטרך לבודד חלק מהשורות לטובת validation לפני שמתחילים להריץ.

איך טוענים

טוענים את הקובץ ישירות מפורמט JSONL, למשל הקובץ 220426-CyberSec-Dataset_escaped.jsonl שנמצא במאגר. אין צורך לבקש אישור גישה מיוחד, המאגר פתוח להורדה מיידית. המבנה פשוט מאוד וכולל בסך הכל שלוש עמודות טקסט: system, user, ו־assistant. מכיוון שכל 99,870 הרשומות נמצאות תחת train בלבד, תצטרכו לחתוך לעצמכם סט בדיקה עצמאי לפני תחילת האימון.

from datasets import load_dataset

ds = load_dataset("AlicanKiraz0/Cybersecurity-Dataset-Fenrir-v2.1")

הרישיון

המאגר מופץ תחת רישיון Apache-2.0. מותר להשתמש בו לפרויקטים מסחריים, לשנות את הנתונים ולאמן עליהם מודלים ללא תשלום תמלוגים. הרישיון דורש לשמור על הודעת זכויות היוצרים והייחוס למחבר המקורי, אך אינו מחייב אתכם לפתוח את קוד המקור של המודל שתאמנו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗