GPT
T

Trendyol-Cybersecurity-Instruction-Tuning-Dataset

קוד פתוח

Trendyolapache-2.02025-07-30

  • cybersecurity
  • defensive-security
  • instruction-tuning
  • threat-intelligence
  • incident-response

מאגר הוראות ממוקד הגנת סייבר עם מעל חמישים אלף דוגמאות טכניות מפורטות. הוא מתאים למי שרוצה לאמן עוזר אבטחה הגנתי בלי להסתכן ביצירת כלי תקיפה.

  • 2,977הורדות בחודש
  • 131לייקים

מה זה

המאגר מכיל 53,202 רשומות במבנה שיחה סטנדרטי של system, user ו assistant, כאשר אורך התשובה הממוצע עומד על כ 700 תוקנים. התוכן מחולק מראש ל 47,882 דוגמאות אימון, 2,660 לוולידציה ו 2,660 לבדיקה. החלוקה הנושאית נשענת בעיקר על אבטחת ענן ודבאופס, מודיעין איומים, תגובה לאירועים ופורנזיקה, לצד אבטחת מודלי למידת מכונה וטכנולוגיות חדשות.

צוות האבטחה של טרנדיול אסף את החומר מתוך יותר מחצי מיליון מקורות, כולל בלוגים מקצועיים, כנסי בלאק האט ודפקון, מאגרי פגיעויות, תיעוד ספציפי של עננים ומאמרים אקדמיים. המידע עבר ניקוי כפילויות סמנטי, בדיקת עובדות נגד הזיות, וסינון קפדני שהסיר שיטות תקיפה כדי להתמקד אך ורק במענה הגנתי, לצד בדיקה ידנית של עשרה אחוזים מהתוכן בידי מומחי אבטחה.

מתאים ל

  • אימון עוזר הגנתי לצוותי אבטחה

    כוונון עדין של מודלי שפה לניתוח התראות אבטחה, כתיבת נהלי תגובה לאירועים וסיוע טכני לחוקרי אבטחה.

  • הטמעת הגנות ענן וקונטיינרים

    אימון מודל שמתמחה במתן פתרונות קונקרטיים לאבטחת תשתיות קוברנטיס, פלטפורמות ענן וסביבות שרתים.

  • בדיקת בטיחות ומניעת שימוש כפול

    הערכה וכיול של מודלים קיימים כדי לוודא שהם עונים על שאלות הגנה אך מסרבים להדריך על שיטות תקיפה.

איפה זה נופל

המאגר כולו באנגלית ואין בו שום תוכן בעברית או התייחסות לרגולציה מקומית. הנתונים נשענים על מקורות עדכניים בעיקר לשנים 2024 ו 2025, עם הטיה מובהקת לתקנים ולרגולציות מערביות. היוצרים מציינים שהרמה הטכנית בחלק מהנושאים עמוקה מדי למשתמשים כלליים, ובנוסף, עולם הסייבר משתנה מהר ומחייב רענון קבוע של הפגיעויות לפני שמשלבים מודל כזה במערכת מבצעית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון אפאצ'י 2.0 מאפשר שימוש מסחרי מלא. תוכלו לאמן איתו מודל פנימי או כזה שנמכר ללקוחות, כל עוד אתם שומרים על תנאי הייחוס והעתק הרישיון של המקור.

האם יש במאגר שאלות או מענה בעברית?

לא, כל 53,202 הרשומות מנוסחות באנגלית בלבד. אם המוצר שלכם צריך לתקשר עם אנליסטים בעברית, תצטרכו לתרגם את הנתונים או להשלים דאטהסט ייעודי בשפה המקומית.

האם המאגר כולל פקודות וטכניקות תקיפה לצורכי בדיקות חדירה?

היוצרים סיננו במכוון כל תוכן שמוגדר התקפי או בעל פוטנציאל הרסני. המאגר ממוקד כולו בזיהוי, חקירה, הגנה וסיכול איומים, וכולל דפוסי סירוב מוכנים לשאלות שמבקשות לבצע מתקפות.

איך המאגר נאסף ועובד?

צוות האבטחה סקר יותר מחצי מיליון מקורות אמינים כמו מאגרי חולשות, ניירות עמדה של כנסים ותיעודי ענן. הטקסטים עברו סינתזה להוראות, הסרת כפילויות, בדיקת עובדות נגד הזיות, ובדיקה אנושית של עשרה אחוזים מהרשומות.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות הפקודה load_dataset עם השם של טרנדיול והחלוקה הרצויה. הנתונים זמינים בקובצי Parquet דחוסים, והמאגר פתוח להורדה מיידית בלי צורך בטופס גישה או אישור מיוחד. השדות הרלוונטיים לעבודה הם system להגדרת התפקיד, user לשאלה הטכנית, ו assistant לתשובה המפורטת.

from datasets import load_dataset

ds = load_dataset("Trendyol/Trendyol-Cybersecurity-Instruction-Tuning-Dataset")

הרישיון

המאגר משוחרר ברישיון אפאצ'י 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולאמן עליו מודלים, בתנאי ששומרים על הודעת הרישיון ומתן הקרדיט ליוצרים. מודל שאומן על הנתונים אינו מחויב ברישיון קוד פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗