GPT
T

TOFU

קוד פתוח

locuslabmit2023-11-14

  • unlearning
  • question answering
  • TOFU
  • NLP
  • LLM

מאגר שאלות ותשובות שנוצר במיוחד לבדיקת היכולת של מודלי שפה לשכוח מידע שלמדו. הוא מבוסס על סופרים בדיוניים לחלוטין כדי למנוע זליגת ידע אמיתי מאימון קודם.

  • 93,766הורדות בחודש
  • 58לייקים

מה זה

המאגר מכיל זוגות של שאלות ותשובות שנבנו סביב אוטוביוגרפיות של 200 סופרים שאינם קיימים במציאות. כל התוכן נוצר באופן סינתטי על ידי מודל GPT-4, במטרה ליצור עולם ידע מבוקר וסגור שאינו קיים ברשת.

המבנה הפנימי מחולק לחבילות שונות שנועדו להערכת ביצועי השכחה. יש את הסט המלא, ולצידו תתי קבוצות שנקראות forget01, forget05 ו forget10, שמייצגות מחיקה של אחוז אחד, חמישה אחוזים או עשרה אחוזים מהמידע, כאשר כל קבוצה כזו מתמקדת בסופר ספציפי. לצד קבוצות המחיקה קיימות קבוצות שימור מקבילות שנועדו לאימון מודל ביקורת, וכן קבצים עם שיבושים מכוונים לבדיקת רגישות המודלים.

מתאים ל

  • מדידת שכחה במודלי שפה

    בדיקה כמותית של מחיקת עובדות ספציפיות ממודל מאומן בלי לפגוע בשאר הידע.

  • אימון מודלי ביקורת

    שימוש בסטים מסוג retain כדי לאמן מודל בסיס שמעולם לא ראה את המידע שנמחק.

  • הערכת עמידות להפרעות

    בחינת יכולת המודל להתמודד עם שאלות משובשות על בסיס קובצי הבדיקה הייעודיים.

איפה זה נופל

כל הנתונים סינתטיים לחלוטין ונוצרו באנגלית בלבד, כך שאין כאן מילה בעברית או ייצוג לשפות אחרות. העובדה שהתוכן יוצר על ידי מודל שפה מוסיפה הטיות סגנוניות אופייניות, ואינה מדמה שגיאות או ניסוחים אנושיים אמיתיים. המאגר מתאים למדידת אלגוריתמים של שכחה בלבד, ולא הייתי משתמש בו לאימון מודל שאמור לענות על שאלות כלליות בעולם האמיתי.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

לא, כל המאגר נוצר באנגלית בלבד באמצעות GPT-4. אין בו תמיכה בשפות נוספות או תרגום מובנה. אם אתם עובדים על מודל בעברית, תצטרכו לתרגם את השאלות והתשובות בעצמכם.

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן, המאגר פורסם תחת רישיון MIT שמאפשר שימוש מסחרי מלא ללא הגבלות מיוחדות. אתם יכולים לאמן עליו מודלים פנימיים או מסחריים, כל עוד אתם מצרפים את תנאי הרישיון והייחוס המקוריים.

מאיפה הגיע המידע והאם הוא אמיתי?

המידע אינו אמיתי כלל ומבוסס על 200 סופרים בדיוניים שהומצאו על ידי GPT-4. הסיבה לכך היא הרצון לוודא שהמודלים הנבדקים לא פגשו את המידע הזה באימון המקדים שלהם ברשת.

מה הגודל של המאגר והאם נדרש אישור גישה מיוחד?

המאגר קטן וכולל בין אלף לעשרת אלפים רשומות המחולקות לקובצי JSON פשוטים. הגישה אליו חופשית לחלוטין בשרתי Hugging Face ללא צורך בהרשמה מוקדמת או אישור מיוחד מצד החוקרים.

איך טוענים

טוענים את המידע ישירות מספריית datasets של Hugging Face בפקודה אחת פשוטה, תוך בחירת החלוקה הרצויה כמו full או קבוצות השכחה השונות. הנתונים זמינים באופן ציבורי ללא צורך באישור גישה או מפתחות מיוחדים, ומאוחסנים בקובצי JSON קלים. הפורמט בנוי במבנה שאלה ותשובה שמתאים ישירות למודלי צ'אט נפוצים כמו Llama2, Mistral או Phi.

from datasets import load_dataset

ds = load_dataset("locuslab/TOFU")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הנתונים ואימון מודלים לכל מטרה, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗