GPT
O

obliteratus

רץ בדפדפן

pliny-the-prompteragpl-3.02026-02-13

  • gradio
  • abliteration
  • mechanistic-interpretability

האפליקציה מאתרת ומסירה מנגנוני סירוב מובנים מתוך מודלי שפה פתוחים בלי אימון מחדש. היא מיועדת לחוקרי בינה מלאכותית ולבודקי אבטחה שרוצים לבחון התנהגות מודלים ללא מגבלות בטיחות.

  • הורדות בחודש
  • 571לייקים

מה זה

בממשק בוחרים מודל מתוך רשימת מודלים נתמכים כמו סדרות Yi, OLMo או OpenELM, מגדירים שיטת פעולה ובוחרים מאגר פרומפטים שמכיל דוגמאות מזיקות ותמימות, למשל מתוך JailbreakBench. המערכת מריצה תהליך שמודד את האקטיבציות של המודל על שני סוגי הקלטים, מחלצת את וקטור הסירוב הפנימי באמצעות פירוק אלגברי כמו SVD, ומשליכה אותו החוצה ממשקולות המודל וההטיות שלו.

בסיום התהליך מקבלים מודל שעבר שינוי ישיר במשקולות, יחד עם בדיקות שבודקות שהשפה וההיגיון הבסיסי נשמרו. הממשק מאפשר לפתוח צ'אט ישיר כדי לבדוק את התוצאה, להשוות אותה למודל המקורי, לצפות במפות גרפיות של שכבות הסירוב ולשלוח את המשקולות המעודכנות ישירות לחשבון שלכם ב־Hugging Face.

מתאים ל

  • בדיקות חדירות למודלים

    הסרת שכבות הסירוב מאפשרת לבחון גבולות אמיתיים של מודלי קוד פתוח כחלק ממחקרי Red Teaming.

  • מחקר גיאומטריית ייצוגים

    ניתוח השכבות מציג בדיוק איפה מנגנוני הסירוב יושבים ברשת הנוירונים ואיך הם משפיעים על שאר המשקולות.

  • יצירת מודלים פתוחים לשיחה

    הורדת מנגנוני חסימה שמונעים כתיבה יוצרת או מחקר לגיטימי של נושאים רגישים שלא פוגעים באיש.

איפה זה נופל

ההליך נועד לעקוף סירובים בלבד, והוא לא מתקן מודל שלא ידע לענות מראש. חלק מהשיטות עלולות לפגוע ביכולות ההסקה של המודל אם מסירים כיוונים שחופפים לחשיבה לוגית. בנוסף, מודלים מסוימים מתקנים את עצמם בין שכבות עמוקות, כך שהסרה פשוטה לא תמיד עובדת במאה אחוז בלי כיול ידני מדויק.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

השימוש בממשק חינמי במסגרת המכסות היומיות של Hugging Face Spaces. משתמשים בעלי מנוי Pro מקבלים יותר זמן ריצה על מאיצי הגרפיקה, אבל אין תשלום ישיר עבור הפעלת הכלי עצמו.

האם המידע שלי נשמר בשרת?

האפליקציה כוללת רכיב טלמטריה שאוסף נתוני ביצועים ומדידות מכל ריצה למאגר ציבורי. אם אתם מייצאים מודל מותאם, הוא נשמר לחשבון שחיברתם, ומומלץ לבדוק את הגדרות הפרטיות של המאגר לפני השליחה.

במה זה שונה מהורדה והרצה של המודל המקורי?

המודל המקורי כולל אימון בטיחות שמסרב לפרומפטים מסוימים לפי הנחיות היצרן. הכלי משנה את המשקולות ישירות כדי לנטרל את התגובה הזו בלי שצריך לאמן את הרשת מחדש.

האם אפשר להריץ את זה מקומית?

כן, הפרויקט כולל חבילת פייתון שניתן להתקין ולהריץ במחשב אישי עם מאיץ גרפי מתאים. יש גם מחברת Colab ייעודית שמאפשרת להריץ את התהליך בסביבה נפרדת ללא הממשק הנוכחי.

איך משתמשים

בוחרים מודל ושיטת הסרה, לוחצים על הפעלת התהליך ועוקבים אחרי הלוגים החיים שמוצגים בחלון. השרת רץ על תשתית של מאיץ A10G שמוקצה לפי דרישה דרך ZeroGPU, כך שאין צורך בהתקנה מקומית או בהרשמה מיוחדת מעבר לחשבון באתר. עם זאת, יש מכסה יומית של זמן עיבוד, ומודלים גדולים שדורשים קוונטיזציה עלולים לקחת זמן או להיעצר אם חורגים מההקצאה החינמית.

הרישיון

הקוד מופץ תחת רישיון AGPL-3.0, שמחייב שיתוף של כל שינוי בקוד המקור תחת אותו רישיון אם מנגישים אותו ברשת. מודלים שנוצרים בתהליך מיוצאים לרוב למאגרים ציבוריים, והכלי כולל איסוף טלמטריה שמשתף נתוני ביצועים בעילום שם לצורכי מחקר.

הרישיון המלא ב־Hugging Face ↗