GPT
U

Ultimate-Offensive-Red-Team

קוד פתוח

WNT3Dmit2025-08-23

  • cybersecurity
  • red-team
  • penetration-testing
  • offensive-security
  • vulnerability-research

המאגר מרכז מעל חצי מיליון רשומות בתחומי אבטחה התקפית, חוזים חכמים וחולשות אבטחה. מפתחים פונים אליו כדי לאמן מודלים על תרחישי תקיפה ובדיקות חדירה.

  • 802הורדות בחודש
  • 157לייקים

מה זה

המאגר כולל יותר מ־550,000 רשומות ייחודיות שמחולקות לכחמישה עשר תחומי אבטחה. המקורות שלו מבוססים על מאגרי ידע ציבוריים, תיעוד של כלי קוד פתוח, מחקרי חולשות שפורסמו, מתודולוגיות תעשייתיות וחומרי הדרכה. המפרסמים לא פירטו תהליך סינון ידני או אוטומטי מעבר לאיסוף המקורות הללו.

התוכן מחולק לקבצי JSON ו־JSONL לפי נושאים. יש בו 412,494 שאלות ותשובות באבטחה, 139,600 חוזי בלוקצ'יין זדוניים, ו־1,202 חולשות ידועות שנוצלו בפועל. בנוסף המאגר מכיל עצי החלטה וכללי התקשרות שמיועדים להנחות פעולות התקפיות אוטונומיות לפי מסגרות עבודה מוכרות.

מתאים ל

  • אימון מודלי שפה באבטחה

    אימון מודל על מאות אלפי שאלות ותשובות טכניות ומושגי אבטחה באנגלית.

  • זיהוי חוזים חכמים זדוניים

    בניית מסווג שמנתח קוד חוזים מתוך מאגר של מעל מאה אלף דוגמאות.

  • מיפוי טכניקות תקיפה

    בדיקת שאילתות על כלי תקיפה, חולשות ידועות ותרחישי בדיקות חדירה.

איפה זה נופל

כל הנתונים במאגר מופיעים באנגלית בלבד, כך שהוא לא יעזור למי שמחפש אימון בעברית. הכרטיס לא מציין תאריכי חיתוך של החולשות, ולא מפרט איך אומתו הדוגמאות שנאספו מהרשת. מי שבונה מודל ייצור יצטרך לבדוק בעצמו אם המידע לא כולל קטעי קוד מיושנים או הזיות שנשאבו ממאגרים ציבוריים ללא אימות מקדים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, הרישיון המדווח הוא MIT. הוא מאפשר לפתח מוצרים מסחריים ולא מחייב לפתוח את הקוד שלכם, כל עוד מצורף הייחוס המקורי.

האם המאגר כולל טקסטים בעברית?

לא, השפה היחידה המדווחת בכרטיס היא אנגלית. כל השאלות, התשובות והתיעוד כתובים באנגלית בלבד.

איך המידע נאסף ועבר סינון?

היוצרים איחדו מידע ממאגרי חולשות ציבוריים, תיעוד של כלי אבטחה וחומרי הדרכה. הכרטיס אינו מתאר תהליך סינון או ניקוי מיוחד שנעשה לאחר האיסוף.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets או בקריאה רגילה של קבצי ה־JSON וה־JSONL מתוך תשעה עשר הקבצים שבמאגר. אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה. לפני שמתחילים לאמן, שימו לב שהנתונים מפוצלים בין קבצי הדרכה כלליים כמו training_data.jsonl לבין קבצים ייעודיים לחולשות, מתודולוגיות וכלים, כך שצריך לבחור את הקבצים שמתאימים למשימה שלכם.

from datasets import load_dataset

ds = load_dataset("WNT3D/Ultimate-Offensive-Red-Team")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. אין חובה לשתף נגזרות תחת אותו רישיון, ומודל שאומן על המידע יכול לשמש גם במוצרים מסחריים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗