GPT
D

DeepHat-V1-7B

קוד פתוח

DeepHatapache-2.02025-04-25

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • code

התאמה ייעודית של מודל קוד פופולרי לתחום אבטחת המידע, עבור משימות התקפיות והגנתיות כאחד. פתרון קומפקטי שמביא יכולות סייבר ישירות למחשב מקומי.

  • 7.6Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.2 GBמשקל הקבצים
  • 16,304הורדות בחודש

מה זה

מדובר בכיוונון עדין של המודל Qwen2.5-Coder-7B, שמכוון ישירות לעולמות אבטחת המידע. היוצרים שלו מייעדים אותו לשימוש כפול, הגנה וסריקת חולשות לצד תרחישים התקפיים, תחום שבו רוב המודלים המסחריים נחסמים מיד בגלל מנגנוני בטיחות מחמירים.

הבסיס שעליו הוא נשען מביא איתו הבנה טובה של קוד ותחביר, וכאן הלבישו עליו שכבה שאמורה לזהות פרצות או לייצר תרחישי בדיקה. במקור המודל מוגדר לחלון הקשר של 32,768 טוקנים, אך תומך בהרחבה עד 131,072 טוקנים באמצעות מנגנון YaRN, מה שמאפשר להזין קבצי קוד ארוכים למדי בלי לאבד את ההקשר המלא.

בכרטיס המודל אין מדדים מספריים, מבחני ביצועים או השוואות מסודרות מול מודלים מתחרים. המשמעות היא שקשה לדעת מראש עד כמה הוא מדויק בניתוח חולשות מורכבות, ומי שבוחר להשתמש בו יצטרך לבדוק אותו עצמאית מול תרחישי הבדיקה שלו.

מתאים ל

  • ניתוח קוד לאיתור חולשות

    התבססות על מודל קוד מאפשרת לו לסרוק סקריפטים ולחפש פרצות הגנה בתוך קוד המקור.

  • תרחישי בדיקות חדירה

    יצירת סקריפטים ובדיקות עומס והתקפה בסביבות מבוקרות בלי חסימות בטיחות מיותרות.

  • בניית סוכני אבטחה

    שילוב בפלטפורמות אוטומציה לצורך מענה מהיר לאירועי אבטחה וניתוח לוגים באנגלית.

איפה זה נופל

הכרטיס לא מספק שום נתוני בדיקה, ציוני דיוק או השוואה מול מודל הבסיס. אי אפשר לדעת מראש אם הוא עבר התאמה מקיפה או אימון קל בלבד. בנוסף, המודל מוגדר לשפה האנגלית בלבד, כך שאין לצפות ממנו להבין דוחות אבטחה בעברית. לפני שסומכים עליו בבדיקות תשתית, חייבים לוודא שהוא לא מייצר הזיות בקוד סקריפטים או מפספס בעיות אבטחה בסיסיות.

שאלות
נפוצות

האם המודל מוגבל בפקודות התקפיות כמו מודלים מסחריים רגילים?

הוא הוגדר מראש לשימוש התקפי והגנתי כאחד, כך שהוא לא אמור לסרב לבקשות לגיטימיות של אנשי אבטחה. עם זאת, המפתחים הגנו על עצמם בתנאי שימוש שמטילים עליכם את האחריות המלאה.

איך אפשר לנתח איתו קבצי קוד גדולים במיוחד?

ברירת המחדל מוגדרת ל־32,768 טוקנים, אך ניתן להגדיר שימוש ב־YaRN בקובץ התצורה כדי להגיע עד 131,072 טוקנים. זה דורש זיכרון וידאו משמעותי יותר אך מאפשר סריקה של פרויקטים שלמים.

איך מריצים

במשקל של 14.2 גיגה בייט בדיוק bfloat16, תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי להריץ אותו מקומית בצורה סבירה. סביבת transformers דורשת גרסה 4.37.0 ומעלה כדי לא להיתקל בשגיאות טעינה של ארכיטקטורת qwen2.

אם אין לכם חומרה מתאימה, היוצרים מציעים גישה דרך deephat.ai או פלטפורמת kindo.ai לבניית סוכנים. עם זאת, הרצה מקומית מלאה היא הדרך היחידה להבטיח שקוד רגיש ובדיקות חדירות לא דולפים לשרתים חיצוניים.

from transformers import pipeline

pipe = pipeline("text-generation", model="DeepHat/DeepHat-V1-7B")
print(pipe("שלום"))

הרישיון

הרישיון הבסיסי מוגדר כ־Apache-2.0, אך המפתחים הוסיפו לו תוספת משפטית של תנאי שימוש והסרת אחריות. אתם אחראים בלעדית לכל נזק, שימוש או אובדן מידע שייגרם ממנו, ומתחייבים לפצות את היוצרים על כל תביעה. מעבר למגבלות אלו, הקוד פתוח לשימוש חופשי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗