GPT
M

Multi-IF

קוד פתוח

facebookcc-by-nc-2.02024-10-18

  • instruction following
  • multi-turn
  • multilingual

המאגר בודק איך מודלים עוקבים אחרי הוראות בכמה שפות לאורך שיחה מתמשכת. הוא נועד למי שרוצה לבחון עמידה באילוצים מורכבים ביותר מסבב בודד.

  • 2,580הורדות בחודש
  • 40לייקים

מה זה

הבסיס כאן הוא הרחבה של IFEval למבנה של שיחה מרובת סבבים. המאגר כולל 4,501 שיחות, כשכל אחת בנויה בדיוק משלושה סבבים של הוראות משתמש, ומשלב עבודה של מודלי שפה לצד מתייגים אנושיים כדי לבנות ולתרגם את הפרומפטים מאנגלית לשבע שפות נוספות.

המבנה כולל רק חלוקת מבחן אחת של 4,501 דוגמאות. בכל רשומה יש שדות ייעודיים לכל אחד משלושת הסבבים, כולל הטקסט של הפרומפט, מזהי ההוראות שצריך לבדוק והארגומנטים הספציפיים שהסקריפט דורש כדי לחשב אם המודל עמד בכללים, לצד שדות שמחזיקים את היסטוריית השיחה והתשובות בזמן הריצה.

מתאים ל

  • בנצ'מרק למעקב הוראות

    בדיקת היכולת של מודל לבצע הנחיות מובנות לאורך שלושה סבבי שיחה.

  • השוואת ביצועים רב לשונית

    בחינת פערים בין שפות לטיניות לשפות כמו רוסית או הינדי בעמידה באילוצים.

  • מדידת שחיקה בשיחה

    בדיקה כמותית של ירידת הדיוק בין הסבב הראשון לסבב השלישי.

איפה זה נופל

אם אתם בונים מוצר בעברית, אין לכם מה לחפש פה. השפות מוגבלות לאנגלית, צרפתית, ספרדית, פורטוגזית, הינדי, סינית, רוסית ואיטלקית בלבד. בנוסף, מדובר בנתונים שמבוססים על תרגום של פרומפטים מאנגלית, והחוקרים עצמם מציינים שפות עם כתב שאינו לטיני כמו הינדי, רוסית וסינית כמקומות שבהם המודלים מועדים יותר לנפילות ולשיעורי שגיאה גבוהים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-2.0, מה שאוסר במפורש שימוש מסחרי מכל סוג. הוא מתאים אך ורק לצורכי מחקר והערכה פנימיים.

האם יש במאגר תמיכה בעברית?

אין עברית כלל. השפות הכלולות הן אנגלית, צרפתית, ספרדית, פורטוגזית, הינדית, סינית, רוסית ואיטלקית.

במה הוא שונה מ־IFEval הרגיל?

IFEval המקורי בודק רק סבב בודד ובאנגלית בלבד. המאגר הזה מרחיב את ההוראות לשלושה סבבי שיחה רצופים ומתרגם אותן לשבע שפות נוספות כדי לבדוק שחיקת ביצועים לאורך זמן.

איך בנו את הנתונים?

השתמשו בשילוב של מודלי שפה ומתייגים אנושיים. הם לקחו את ההוראות המקוריות, הרחיבו אותן לרצפים של שיחה, ותרגמו את הפרומפטים לשפות היעד.

איך טוענים

טוענים את הקובץ multiIF_20241018.csv ישירות מקבצי המאגר. אין כאן צורך בבקשת גישה מיוחדת, וההורדה מיידית. שדות המפתח שמעניינים אתכם לפני הרצה הם turn_1_prompt עד turn_3_prompt בשביל הקלט למודל, והשדות הנלווים של instruction_id_list ו־kwargs עבור כל סבב, שנחוצים לסקריפט ההערכה של פייסבוק בגיטהאב.

from datasets import load_dataset

ds = load_dataset("facebook/Multi-IF")

הרישיון

הרישיון הוא cc-by-nc-2.0. בעברית פשוטה, אסור להשתמש בנתונים האלה לשום צורך מסחרי, אלא רק למחקר או לשימוש פנימי לא רווחי, וחובה לתת קרדיט ליוצרים. אם אתם מתכננים לאמן עליו מודל כדי למכור גישה אליו, רדו מזה.

הרישיון המלא ב־Hugging Face ↗