GPT
E

ExploreToM

קוד פתוח

facebookcc-by-nc-4.02024-12-09

  • theory-of-mind
  • reasoning

המאגר כולל דגימות טקסט שנועדו לבחון יכולות של מודלי שפה בהבנת מצבים נפשיים ומחשבות של אחרים. הנתונים יוצרו אוטומטית בצורה עוינת ומכוונת כדי להכשיל את המודל Llama 3.1 70B Instruct.

  • 2,747הורדות בחודש
  • 47לייקים

מה זה

מדובר בנתונים שנוצרו באמצעות אלגוריתם חיפוש בשם A כוכב על שפה ייעודית, שבונה עלילות מורכבות וממלא אותן בפרטים. המטרה של התהליך היא לאתר תרחישים שבהם מודל היעד מתבלבל בהסקת מסקנות פסיכולוגיות, במקום להשתמש בסיפורים אנושיים שגרתיים. החוקרים יצרו עשרה מבני סיפור בתוך 18 הגדרות שונות שנחקרו במאמר, תוך שימוש בתקציב של 50 צמתים למבנה.

התוכן עצמו מחולק למשימות של מענה על שאלות. השאלות בודקות תפיסות של דמויות שונות, כולל דרגות שונות של הבנת מחשבות של אחרים, לצד שאלות עובדתיות או שאלות זיכרון רגילות שאינן דורשות הבנה פסיכולוגית מורכבת.

מתאים ל

  • אימון מחקרי להבנת מחשבות

    אימון משקלות על דוגמאות מורכבות כדי לשפר הסקת מסקנות לגבי כוונות של דמויות.

  • בדיקת עמידות ללאמה

    בחינה מהירה של Llama 3.1 70B Instruct מול דוגמאות שפותחו בדיוק כדי להכשיל אותו.

  • הרחבת נתונים דרך הקוד

    שימוש בתבנית הנתונים כדי לייצר דוגמאות דומות בעזרת הקוד שפורסם במאגר הפרויקט.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין כאן אף מילה בעברית. מעבר לכך, זהו מדגם שנוצר באופן אדברסריאלי ספציפית נגד Llama 3.1 70B Instruct, והחוקרים עצמם מזהירים שלא להשתמש בו כמבחן סטנדרטי קבוע. אם אתם רוצים לבחון מודל אחר, הנתונים האלה עלולים לא לאתר את נקודות התורפה שלו, ועדיף להריץ את קוד היצירה המקורי מול המודל שלכם.

שאלות
נפוצות

האם אפשר להשתמש במאגר כדי לבנות פיצ׳ר למוצר?

לא. הרישיון הוא לשימוש לא מסחרי בלבד. כל שימוש בתוך מוצר מניב הכנסה או שירות מסחרי מפר את תנאי הרישיון של מטא.

האם הדאטהסט כולל תמיכה בעברית?

לא. כל הסיפורים, השאלות והמבנים שנוצרו במאגר מופיעים באנגלית בלבד. תרגום של הנתונים עלול לפגוע במבנה הלוגי העדין של השאלות.

איך הנתונים נאספו והאם בני אדם כתבו אותם?

בני אדם לא כתבו את הסיפורים האלה. הנתונים נוצרו אוטומטית באמצעות חיפוש שרץ על שפה מובנית ואיתר תרחישים שמבלבלים מודל שפה, ולאחר מכן עברו מילוי פרטים.

למה החוקרים ממליצים לא להשתמש בזה כמבחן סטנדרטי?

הדגימות כאן הותאמו במיוחד לנקודות התורפה של מודל ספציפי. מודלים אחרים עשויים ליפול במקומות אחרים לחלוטין, ולכן עדיף להריץ את אלגוריתם החיפוש מחדש על המודל שאתם רוצים לבדוק.

איך טוענים

אין כאן צורך לבקש אישור גישה מיוחד. המאגר מכיל בסך הכל שלושה קבצים, והדגימה המרכזית יושבת בקובץ פשוט מסוג CSV בשם ExploreToM data sample csv לצד תיעוד קצר. אפשר לקרוא אותו ישירות בקוד שלכם או להוריד ידנית. כשמנתחים את העמודות, חשוב לשים לב לשדות שמגדירים את תכונות השאלה והסיפור, כמו מאפייני זיכרון או פרמטרים של החיפוש, שמסבירים אם השאלה באמת בודקת הבנה תודעתית או רק עובדות.

from datasets import load_dataset

ds = load_dataset("facebook/ExploreToM")

הרישיון

הרישיון כאן הוא cc by nc 4.0, מה שאומר שאסור לעשות בו שום שימוש מסחרי. מותר להשתמש בנתונים למחקר ולמטרות פנימיות, כל עוד נותנים קרדיט מלא ליוצרים לפי הכללים. אם תאמנו מודל ישירות על הדאטהסט הזה, הרישיון ימנע מכם למכור אותו או לספק באמצעותו שירות מסחרי בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗