GPT
I

IFEval

קוד פתוח

googleapache-2.02023-12-22

בנצ'מרק שבודק אם מודל שפה באמת מציית להוראות מבניות מדויקות, ולא רק מנחש כיוון כללי. הוא מכיל כחמש מאות פרומפטים עם תנאים שאפשר לאמת בקוד בלי צורך במודל שופט.

  • 348,559הורדות בחודש
  • 164לייקים

מה זה

המאגר מכיל 541 רשומות בחלוקה יחידה של train, המיועדות בפועל לבדיקת ביצועים של מודלים שעברו כוונון להוראות. כל רשומה כוללת את מזהה הפרומפט, טקסט הפרומפט עצמו, רשימת מזהי ההוראות שנדרש לבדוק, ומערך ארגומנטים שמגדיר את תנאי הבדיקה.

המטרה היא בדיקה מבוססת היוריסטיקה של כללים ברורים, כמו דרישה לאורך טקסט של מעל 400 מילים או שילוב מילת מפתח מספר מוגדר של פעמים. הכרטיס אינו מפרט תהליך סינון ידני או אוטומטי מעבר להגדרת הפורמט, ומפנה למאמר המחקרי של גוגל לגבי רשימת ההוראות המלאה.

מתאים ל

  • הערכת ציות להוראות

    בדיקה אובייקטיבית אם מודל שפה עומד באילוצים נוקשים של אורך, מבנה ומילות מפתח.

  • השוואת מודלים מקומית

    הרצת אותו סט בדיקות שקיים ב־Open LLM Leaderboard על מודלים פנימיים בארגון.

  • ולידציה לכוונון עדין

    בחינה אם אימון על הוראות שיפר או פגע ביכולת של המודל לעקוב אחרי כללים מוגדרים.

איפה זה נופל

כל הנתונים במאגר כתובים באנגלית בלבד, כך שהוא לא יעזור לבדוק ציות להנחיות בעברית או בשפות אחרות. הכרטיס לא מספק מידע על מקור הטקסטים, על הטיות אפשריות בתוכן או על מגבלות כיסוי של סוגי ההוראות. בנוסף, המאגר פורסם בסוף 2023 ומכיל רק כחמש מאות דוגמאות, כך שהוא בודק סט מצומצם ומוגדר מראש של אילוצים ואינו מכסה את כל מגוון המשימות שמשתמשים דורשים ממודל בעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפעילות מסחרית?

כן. הדאטהסט שוחרר ברישיון apache-2.0, שמתיר שימוש מסחרי מלא ומאפשר לשלב אותו בתהליכי פיתוח ובדיקה של מוצרים עסקיים. נדרש רק לשמור על הקרדיט והודעת הרישיון המקורית של גוגל.

האם המאגר כולל בדיקות בשפה העברית?

לא. המאגר מוגדר רשמית תחת קוד השפה en ומכיל טקסטים באנגלית בלבד. כדי לבדוק מודלים בעברית על אותם עקרונות, תצטרכו לתרגם את הפרומפטים ולהתאים את פונקציות הבדיקה.

כמה רשומות יש במאגר ומה הגודל שלו?

מדובר במאגר קטן מאוד שכולל 541 רשומות בלבד בחלוקת train אחת. הקובץ העיקרי מגיע בפורמט jsonl, שוקל מעט מאוד ויורד בשניות בודדות בלי ליצור עומס אחסון.

איך המאגר מאמת שהמודל ביצע את ההוראה?

במקום להשתמש במודל שפה אחר בתור שופט, המאגר מסתמך על תנאים הניתנים לאימות חד-משמעי בקוד. שדות המידע instruction_id_list ו־kwargs מגדירים חוקים קבועים, כמו ספירת מילים או חיפוש ביטויים מסוימים בתשובה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets עם השם google/IFEval, ללא צורך בבקשת גישה מיוחדת או אישור מקדים. הקובץ המרכזי במאגר הוא ifeval_input_data.jsonl, שמכיל פחות משש מאות שורות ולכן יורד כמעט מיד ולא דורש משאבי זיכרון מיוחדים. לצורך הרצה ובדיקה מעשית, השדות החשובים לניתוח התוצאה הם prompt מול צמד השדות instruction_id_list ו־kwargs, שמכילים את הלוגיקה לבדיקת הפלט.

from datasets import load_dataset

ds = load_dataset("google/IFEval")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי. הוא אינו כולל דרישה להפיץ עבודות נגזרות תחת אותו רישיון, ומאפשר להשתמש בו באופן חופשי להערכה או לפיתוח מוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗