GPT
A

All-CVE-Records-Training-Dataset

קוד פתוח

AlicanKiraz0apache-2.02025-06-10

  • cybersecurity
  • cve
  • vulnerability

המאגר מרכז כ־300 אלף דיווחי אבטחה היסטוריים שהומרו למבנה של שיחת מומחה. מי שבונה סוכן או מאמן מודל לניתוח חולשות מקבל כאן נתונים טכניים מוכנים לשימוש בלי לפרק פידים גולמיים בעצמו.

  • 417הורדות בחודש
  • 60לייקים

מה זה

המאגר מבוסס על דיווחי פגיעויות רשמיים שפורסמו בין השנים 1999 ל־2025. המקורות כללו קובצי XML ישנים בפורמט 4.0 לצד קובצי JSON מודרניים בגרסה 5 ומעלה. כל רשומה עברה עיבוד, ניקוי כפילויות, והעשרה בנתוני סיווג כמו מדדי חומרת פגיעות, קטגוריות חולשה של CWE, ורשימות של מוצרים מושפעים. במקום להשאיר את המידע בצורתו המקורית כסכמת אבטחה יבשה, היוצרים הזריקו הנחיות מומחה והמירו כל רשומה למבנה שיחה טבעי.

המבנה מחולק לשלושה חלקים ברורים. שמונים אחוז מהמידע נמצא בקובץ האימון שכולל 240,000 דוגמאות. עשרת האחוזים הבאים מיועדים לוולידציה עם 30,000 רשומות, ועשרת האחוזים הנותרים, 27,441 רשומות, מוקצים לבדיקה. החלוקה הזו חוסכת את הצורך לחתוך את הנתונים ידנית לפני תחילת העבודה.

מתאים ל

  • אימון מודלים לסיווג חולשות

    פיין-טיונינג למודלי שפה לצורך זיהוי דרגות חומרה, קטגוריות CWE, והערכת השפעה על מוצרים.

  • בסיס ידע למערכות שליפה

    חיבור המאגר למערכת RAG כדי לספק לצוותי הגנה מענה מהיר ומדויק על פגיעויות היסטוריות.

  • אוטומציה של בדיקות חדירה

    הזנת סוכני אבטחה אוטונומיים בנתוני חולשות ודרכי תקיפה מוכרות לצורך ניתוח מערכות.

איפה זה נופל

כל הטקסט במאגר כתוב באנגלית טכנית, כך שמי שמחפש מידע בעברית לא ימצא אותו כאן. בנוסף, לא מדובר בשיחות אנושיות אמיתיות אלא ברשומות מובנות שהולבשו על שלד של שיחה באמצעות תבניות אוטומטיות. הדבר עלול להוביל לחזרתיות בסגנון הניסוח. הנתונים מגיעים עד שנת 2025, כך שפגיעויות חדשות מאותו רגע ואילך פשוט לא קיימות בקובץ ודורשות עדכון ממקורות חיצוניים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא Apache 2.0, שמתיר שימוש מסחרי, שינוי של המידע והפצה. התנאי הוא מתן קרדיט ושמירה על תנאי הרישיון המקורי.

האם הדאטהסט כולל טקסטים בעברית?

לא. כל המידע נאסף מפידים רשמיים של CVE ומנוסח באנגלית בלבד. אם המוצר שלכם מיועד לעברית, תצטרכו לתרגם את השאלות והתשובות.

איך נוצרו הנתונים והאם אלו שיחות אמיתיות?

הנתונים נאספו ישירות מקובצי XML ו־JSON רשמיים מ־1999 עד 2025. תהליך אוטומטי העשיר את המידע והמיר אותו למבנה של שיחת משתמש ומומחה.

איך המאגר הזה שונה מפיד CVE רגיל?

פיד רגיל מגיע כמבנה נתונים יבש הדורש עיבוד רב. המאגר הזה כבר מארגן את הנתונים כשיחה, כולל מדדי חומרה והקשר טכני מורחב שמוכן ישר לאימון.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בלי צורך באישור גישה או במפתח מיוחד. הקובץ המרכזי יושב בפורמט jsonl ושוקל מעט ביחס למאגרי ענק, כך שאפשר להוריד אותו במהירות. המבנה כולל שלושה שדות טקסט בלבד: הנחיית מערכת שמגדירה את תפקיד חוקר האבטחה, שאלת משתמש לגבי חולשה מסוימת, ותשובת מודל מפורטת שמכילה את ניתוח הפגיעות וההקשר הטכני.

from datasets import load_dataset

ds = load_dataset("AlicanKiraz0/All-CVE-Records-Training-Dataset")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי מלא, שינוי של הנתונים, ושילוב שלהם במוצרים סגורים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף מודלים שאומנו עליו תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗