GPT
D

deberta-v3-base-prompt-injection

קוד פתוח

protectaiapache-2.02023-11-25

  • transformers
  • onnx
  • safetensors
  • deberta-v2
  • text-classification

מסווג קטן שנועד לעצור הזרקות פרומפטים לפני שהן מגיעות למודל הגדול שלכם. הוא נותן ציון בינארי מהיר, אבל הפרויקט המקורי כבר בארכיון ויש לו גרסה חדשה יותר.

  • 184Mפרמטרים
  • 512טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 45,652הורדות בחודש

מה זה

מדובר באימון ייעודי על בסיס DeBERTa-v3 עם 184 מיליון פרמטרים, שמטרתו אחת בלבד: להחזיר אפס אם הטקסט תמים, או אחת אם מישהו מנסה לעקוף הוראות. הדאטה ששימש לאימון הורכב מכמה מאגרי קוד פתוח, ביחס של שבעים אחוז פרומפטים רגילים מול שלושים אחוז ניסיונות תקיפה.

במבחני הערכה המודל הציג דיוק כמעט מושלם של מעל 99.9 אחוז בבדיקות, אבל מספרים כאלה במבחן סינתטי אומרים בעיקר שהוא שינן מצוין את הדוגמאות שהיו במאגר. בעולם האמיתי, תוקפים משנים ניסוחים בלי הפסקה ושיעורי התפיסה בפועל תמיד נמוכים בהרבה ממה שנמדד בסביבה סגורה.

מתאים ל

  • סינון קלט בוטים באנגלית

    חוסם ניסיונות עקיפה של משתמשים ישירות בשכבת ה־API לפני שהם מגיעים למודל יקר.

  • שער אבטחה מקומי וזול

    בדיקת טקסט מהירה על מעבד רגיל בלי לשלוח שום מידע רגיש לשירותי ענן חיצוניים.

  • בדיקת פרומפטים במערכות סוכן

    סריקה מהירה של קלטים ממוקדים כדי למנוע השתלטות על כלים וסוכנים אוטונומיים.

איפה זה נופל

הבעיה המרכזית היא שהיוצרים ארכבו את הפרויקט והפסיקו לתחזק אותו, כשיש כבר גרסה שניה עדכנית יותר באותו חשבון. בנוסף, המודל אומן על אנגלית בלבד, כך שבקשות בעברית או תקיפות מעורבות שפות יעברו אותו בקלות בלי להדליק נורית אדומה.

מעבר לזה, חלון ההקשר מוגבל ל־512 טוקנים, מה שפוסל אותו מניתוח מסמכים ארוכים או שיחות מתמשכות, והכרטיס מציין במפורש שסגנונות טקסט שלא נכללו באימון יגרמו לו לפספס.

אותה משפחה

deberta-v3-base-prompt-injection יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את המודל הזה כרגע?

עדיף שלא. היוצרים עצמם הפסיקו לתחזק את המאגר הזה והוציאו גרסה שניה בשם deberta-v3-base-prompt-injection-v2. אם אתם מתחילים פרויקט חדש, תשתמשו ישירות בגרסה המעודכנת.

האם המודל יזהה ניסיונות הזרקה בעברית?

לא. המודל אומן על אנגלית בלבד ואין לו את היכולת לזהות דפוסי הזרקת הוראות שנכתבו בעברית. שימוש בו לקלט מקומי פשוט יפספס את רוב ההתקפות.

איך מריצים

בזכות הגודל הצנוע ומשקל קבצים של 2.1 גיגה בייט, אפשר להריץ אותו ישירות על מעבד רגיל דרך ONNX וספריית Optimum בלי לחשוב פעמיים. אין שום צורך בכרטיס מסך ייעודי כדי לקבל תגובה מהירה ברמת המילישניות על משפטים בודדים.

אם יש לכם שרת מקומי או קונטיינר קטן, חבל לשלם לספקי צד שלישי על API של סריקת קלט. אתם מושכים את המשקולות דרך ספריית transformers, עוטפים ב־pipeline בסיסי, ויש לכם שער אבטחה מקומי שלא מוציא מידע החוצה.

from transformers import pipeline

pipe = pipeline("text-classification", model="protectai/deberta-v3-base-prompt-injection")
print(pipe("שלום"))

הרישיון

המודל מפורסם תחת רישיון apache-2.0, שבאופן עקרוני מתיר שימוש מסחרי, שינוי והפצה. עם זאת, היוצרים הוסיפו אזהרה חריגה לפיה חלק ממאגרי המידע ששימשו לאימון עשויים לכלול תנאים מחמירים יותר או הגבלות לא מסחריות, ולכן מי שמשלב אותו במוצר מסחרי צריך לבדוק היטב את החשיפה המשפטית שלו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗