GPT
C

clawhub-security-signals

קוד פתוח

OpenClawmit2026-05-28

  • security
  • llm-security
  • agentic-ai
  • agent-skills
  • openclaw

המאגר מרכז 67,453 מיומנויות סוכנים עם סריקות אבטחה משלושה כלים שונים שנוטים לא להסכים ביניהם. הוא מיועד למי שרוצה לאמן מודלים לזיהוי סיכוני אבטחה בקוד ובהרשאות של סוכני בינה מלאכותית.

  • 340הורדות בחודש
  • 53לייקים

מה זה

כל רשומה מייצגת גרסה ציבורית של סקיל מתוך ClawHub. המידע כולל את קובץ התיאור של הסקיל בגרסה שעברה צנזורה של פרטים מזהים, קבצים נלווים מנוקים במידה והיו כאלה, ואת ממצאי הסריקה שהתקבלו מניתוח סטטי, מ־VirusTotal ומהכלי הסמנטי SkillSpector של NVIDIA. בנוסף מופיע סיווג כולל של מערכת הרישום, שמחלקת את המקרים לנקי, חשוד או זדוני.

המאגר כולל 47,262 רשומות באימון, 10,076 בוולידציה, 6,747 בבדיקה, ועוד 3,368 רשומות בחלק שמור להערכה. בתוך כל אלה יש 13,255 רשומות שמכילות קבצי חבילה בפועל, כאשר רק ב־6,785 מהן יש קובצי קוד אמיתיים בנפח כולל של כ־279 מגה-בייט. שאר הרשומות מתבססות בעיקר על טקסט התיאור והמטא-דאטה שנאספו מהמערכת.

מתאים ל

  • אימון מסווגי סיכונים

    זיהוי אוטומטי של הרשאות יתר, הזרקות הוראות וקוד מסוכן בסקילים לסוכנים.

  • הערכת כלי בדיקה סטטיים

    מדידת חפיפה ופערים בין דוחות אבטחה שונים על פני אלפי חבילות אמיתיות.

  • סינון מקדים למאגרי כלים

    בניית שכבת הגנה ראשונית שמסמנת סקילים שדורשים בדיקה אנושית לפני התקנה.

איפה זה נופל

זה לא מאגר עם תיוג ידני מושלם אלא תקן כסף שמבוסס על סיווגים אוטומטיים. מתוך עשרות אלפי הרשומות, רק 206 סווגו כזדוניות בפועל, בעוד ש־25,504 מוגדרות כחשודות, שזה פח אשפה רחב מאוד שכולל גם חוסר בהירות בהרשאות ולא רק תקיפות. כל הטקסטים והסקילים הם באנגלית בלבד. בנוסף, הכלים כמעט לא מסכימים ביניהם וסורק יחיד מוביל את רוב ההתרעות, כך שאי אפשר להסתמך על תווית בודדת כמקור אמת בלי להבין מה כל סורק בודק.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. הרישיון המדווח הוא MIT, שמתיר שימוש מסחרי חופשי, כולל אימון מודלים והטמעתם במוצרים סגורים. הדרישה היחידה היא לצרף את תנאי הרישיון המקוריים ואת הודעת זכויות היוצרים.

האם המאגר מכיל דוגמאות בעברית?

לא. כל הנתונים, התיאורים והסקילים במאגר הם באנגלית בלבד. אם המערכת שלכם צריכה לנתח הוראות או סקילים שנכתבו בעברית, תצטרכו לאסוף או לתרגם נתונים ממקורות אחרים.

איך נאספו התוויות והאם הן אמינות?

התוויות לא נקבעו על ידי אנשי אבטחה שבדקו כל שורה, אלא הופקו אוטומטית ממערכת הרישום של ClawScan לצד סורקים כמו VirusTotal ו־SkillSpector. מדובר במאגר ברמת כסף שבו התוויות משקפות ממצאי כלים אוטומטיים וחשדות, ולא בהכרח נוזקות ודאיות.

כמה קוד אמיתי יש בתוך הרשומות?

רק ב־13,255 רשומות מתוך ה־67,453 יש קבצים נלווים, ומתוכן רק 6,785 מכילות קובצי קוד בפועל, בנפח של 278.9 מגה-בייט. רוב הדאטהסט מורכב מטקסט התיאור של הסקיל וממצאי הסורקים ולא מקוד תוכנה מלא.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות פקודת load_dataset ישירות מהמזהה של המאגר. המידע מחולק לארבעה קבצי JSON Lines נפרדים ואינו דורש אישור גישה מקדים או הרשמה מיוחדת. לפני הריצה כדאי לשים לב לשדה התוויות הראשי clawscan_verdict, וכן לשדות המכילים את פרטי הסורקים השונים, כמו skillspector_issue_categories ונתוני הקוד המנוקים בתוך skill_bundle_content, שדורשים פריסה ועיבוד משלהם.

from datasets import load_dataset

ds = load_dataset("OpenClaw/clawhub-security-signals")

הרישיון

המאגר מופץ תחת רישיון MIT מתירני. מותר להשתמש בנתונים למטרות מסחריות ולמחקר, לשנות אותם ולשלב אותם בקוד סגור, בלי חובת שיתוף תחת אותו רישיון. כל מה שנדרש הוא לשמור על הודעת זכויות היוצרים והרישיון המקורי. השימוש אינו מגביל הפצה של מודלים שאומנו עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗