GPT
D

deberta-v3-base-injection

קוד פתוח

deepsetmit2023-05-17

  • transformers
  • pytorch
  • safetensors
  • deberta-v2
  • text-classification

מסווג קטן ומהיר שבודק אם טקסט נכנס מנסה לתקוף מודלי שפה בעזרת הזרקת הוראות. הפתרון מתאים למי שחייב שכבת הגנה מקומית בלי לשלוח כל קלט לשירות ענן יקר.

  • 184Mפרמטרים
  • 512טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 13,778הורדות בחודש

מה זה

מדובר בהתאמה של DeBERTa v3 Base למשימה אחת ויחידה: סיווג טקסט כבקשה תמימה (LEGIT) או כניסיון הזרקת הוראות (INJECTION). החיבור נעשה על בסיס סט נתונים ייעודי, ומאחוריו עומדים 184 מיליון פרמטרים. הרעיון הוא להציב אותו כשער כניסה לפני קריאה למודל שפה כבד, כדי לחסוך טוקנים ולמנוע מניפולציות של משתמשים.

התוצאות על סט הבדיקה מציגות דיוק של 99.14 אחוז עם שגיאה של 0.0673, אבל צריך לקחת את זה בהקשר הנכון. הנתונים שעליהם הוא אומן מגדירים בקשות תמימות רק כשאלות מגוונות או חיפושי מילות מפתח. אם הבקשות אצלכם נראות אחרת, המספרים האלה לא יישמרו בפרודקשן.

מתאים ל

  • סינון קלט למודלי שפה

    בדיקת טקסט חופשי לפני שליחה ל־LLM כדי לחסום ניסיונות עקיפת הנחיות.

  • הגנה על תיבות צ'אט בוט

    מחסום ראשוני וזול על השרת שעוצר פרומפטים זדוניים באנגלית ובגרמנית.

  • בקרת שאילתות חיפוש

    זיהוי משתמשים שמנסים להזריק הוראות מוסתרות דרך מנועי חיפוש פנימיים.

איפה זה נופל

הבעיה המרכזית שלו היא נטייה לפסול בקשות תמימות. המפתחים עצמם מזהירים שהוא עלול להיות אגרסיבי מדי ולסמן משתמשים לגיטימיים כניסיונות פריצה. זה קורה בעיקר כשהקלט חורג ממבנה פשוט של שאלה או חיפוש, כמו פקודות מורכבות, קוד או ניסוחים ארוכים. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, והוא אומן רק על אנגלית וגרמנית, כך שהוא לא יעיל לזיהוי מתקפות בעברית.

שאלות
נפוצות

האם הוא מזהה הזרקות שנכתבו בעברית?

לא. המודל אומן ותומך רק באנגלית ובגרמנית. אם תעבירו לו עברית, הוא לא ידע לזהות את ההקשר ועלול לספק תוצאות שגויות ואקראיות.

מה אפשר לעשות כשהוא חוסם יותר מדי משתמשים תמימים?

היוצרים ממליצים לאסוף דוגמאות אמיתיות של בקשות תקינות מהמערכת שלכם, ולבצע אימון חוזר על בסיס סט הנתונים המקורי כדי לכייל את הרגישות.

איך מריצים

בזכות משקל של 1.4 גיגה בייט בלבד, הוא רץ בלי בעיה על מעבד רגיל, ולא מחייב כרטיס גרפי ייעודי כדי לעמוד בזמני תגובה טובים. קריאה ישירה דרך ספריית transformers בפייתון מאפשרת לטעון אותו לזיכרון השרת המקומי ולסווג כל קלט תוך מילישניות בודדות.

אין פה גרסאות מקוצצות או מורכבות יותר. אם אתם מטפלים בכמויות נמוכות מאוד של טקסט, אפשר לפנות לשרת מנוהל כדי לא לתחזק מכונה, אבל בגודל כזה בדרך כלל משתלם להריץ אותו עצמאית לצד האפליקציה.

from transformers import pipeline

pipe = pipeline("text-classification", model="deepset/deberta-v3-base-injection")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון MIT. המשמעות פשוטה: מותר להשתמש בו למוצרים מסחריים, לשנות את המשקלים, לאמן אותו מחדש או לארוז אותו בתוך שירות סגור, בלי צורך לחשוף את הקוד שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗