GPT
V

VulnLLM-R-7B

קוד פתוח

Virtue-AI-HUBapache-2.02025-06-05

  • safetensors
  • qwen2
  • security
  • vulnerability-detection
  • code-analysis

הוא מנתח קוד כדי לאתר חולשות אבטחה בעזרת שרשרת חשיבה מפורטת. מודל ממוקד שמתחרה בכלים גדולים בהרבה במשימת ביקורת קוד.

  • 7.6Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.2 GBמשקל הקבצים
  • 4,425הורדות בחודש

מה זה

מדובר במודל שמבוסס על ארכיטקטורת Qwen2 עם 7.6 מיליארד פרמטרים, שעבר התאמה ספציפית למציאת חולשות אבטחה בתוכנה. במקום לנחש תבניות כמו מודלים כלליים קטנים או כלי ניתוח סטטי, הוא מייצר נימוק שלב אחר שלב שבודק זרימת מידע ובקרת זרימה בקוד.

היוצרים שלו מדווחים על תוצאות שגוברות על מודלים מסחריים כמו Claude-3.7-Sonnet ו־o3-mini במבחנים כמו PrimeVul, Juliet 1.3 ו־ARVO. בפועל זה אומר שהוא מנסה להבין את ההקשר הלוגי של הבאג ולא רק לסמן שורות חשודות, כשהוא ממוקד בשפות C, C++, פייתון וג'אווה.

מתאים ל

  • סריקת PR באבטחה

    הוא מסביר את הסיבה לחולשה בשרשרת חשיבה, ומסייע לבדוק שינויי קוד קצרים ב־C, פייתון או ג'אווה.

  • ביקורת קוד מקומית ללא ענן

    הגודל הקומפקטי שלו מאפשר לבצע בדיקות אבטחה בשרת מבודד בלי לחשוף קוד קנייני לשירות חיצוני.

  • סינון ממצאי כלי ניתוח סטטי

    הוא בוחן זרימת מידע לוגית ויכול לנמק אם ממצא של כלי אוטומטי הוא אכן בעיה ממשית.

איפה זה נופל

המודל מדבר ומבין רק אנגלית וקוד, בלי תמיכה בעברית. הכרטיס מציג הצלחות במבחנים מוגדרים מראש, אך לא מפרט על שיעורי אזעקות שווא, שמציפים בדרך כלל צוותי פיתוח. בנוסף, חלון ההקשר מוגבל יחסית לפרויקטים שלמים, ולכן אי אפשר לזרוק אליו ריפו שלם בלי לחתוך אותו לפונקציות.

שאלות
נפוצות

האם הוא יכול להחליף לגמרי כלי ניתוח סטטי כמו CodeQL?

לא. כלי ניתוח סטטי מכסים חוקים בצורה עקבית בכל הפרויקט, בעוד מודל שפה עלול לפספס מקרים או להמציא הסברים. הוא מתאים כרובד ניתוח נוסף שבודק לוגיקה מורכבת.

אפשר לסרוק איתו מאגר קוד שלם בבת אחת?

לא ישירות. חלון ההקשר מוגבל לכ־32 אלף טוקנים, ולכן צריך לפרק את הקוד לקבצים או לפונקציות ספציפיות ולא להזין מערכת שלמה בבת אחת.

איך מריצים

כדי להריץ אותו מקומית בפורמט המקורי צריך כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון גרפי, בהתחשב במשקל קבצים של 14.2 גיגה ב־bfloat16. חלון ההקשר עומד על 32,768 טוקנים, כך שאם תעמיסו פונקציות ענקיות או קבצים שלמים צריכת הזיכרון תעלה מהר מאוד.

אם אין לכם שרת ייעודי או מאיץ מתאים בענן, להחזיק כרטיס כזה עבור סריקות מזדמנות יעלה יותר משימוש ב־API של מודל חיצוני. שווה להרים אותו רק כשיש דרישה קשיחה שלא להוציא קוד מחוץ לתשתית המקומית של החברה.

pip install -U huggingface_hub
hf download Virtue-AI-HUB/VulnLLM-R-7B

הרישיון

הוא מופץ תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקולות, ולשלב אותו במוצר פנימי או חיצוני, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗