GPT
I

ifeval-like-data

קוד פתוח

argillaother2024-09-30

  • synthetic
  • distilabel
  • rlaif

אימון מודלים על מילוי הוראות מדויקות דורש דוגמאות מובנות היטב. כאן תמצאו זוגות סינתטיים של פרומפט ותשובה בסגנון IFEval שנוצרו עם מודל חזק ועברו בדיקת תקינות רשמית.

  • 6,380הורדות בחודש
  • 50לייקים

מה זה

המאגר כולל זוגות של פרומפטים ותשובות שנוצרו בצורה סינתטית לחלוטין באמצעות המודל Qwen2.5-72B-Instruct. תהליך היצירה התבסס על שיטת MagPie וכמה הנחיות מערכת, במטרה לחקות את הפורמט של בנצ'מרק IFEval המוכר. הנתונים נבדקו מול כלי ההערכה של lm-evaluation-harness כדי למדוד עמידה בהוראות קשיחות.

המבנה מחולק לשני תתי מאגרים שונים. החלק הראשון נקרא default והוא מכיל כחמש מאות וחמישים אלף שורות גולמיות ללא סינון, שכוללות לעיתים הנחיות סותרות ותשובות שגויות. החלק השני נקרא filtered, והוא כולל רק רשומות שבהן התשובה עמדה בהצלחה מלאה במדד הקפדני של הבנצ'מרק, מה שהופך אותו למתאים ישירות לאימון.

מתאים ל

  • אימון למילוי הוראות

    כוונון עדין של מודלי שפה על החלק המסונן כדי לשפר ביצועים במשימות מעקב אחר חוקים.

  • שחזור תהליכי דאטה

    הרצת סקריפט הייצור של distilabel לבניית מאגרי מידע סינתטיים דומים באופן עצמאי.

  • בדיקת מודלים פנימית

    הערכת היכולת של מודלים קיימים להתמודד עם דרישות מבנה מורכבות כמו אורך ומילות מפתח.

איפה זה נופל

הנתונים כולם סינתטיים ומגיעים ממודל יחיד, מה שמביא איתו את סגנון הכתיבה וההטיות של מודל המקור. השפה הבלעדית כאן היא אנגלית, כך שאין שום כיסוי לעברית או לשפות אחרות. אם תבחרו לעבוד עם החלק הלא מסונן, קחו בחשבון שיש בו שגיאות עובדתיות, אי ציות להוראות ופרומפטים שסותרים את עצמם. חובה לוודא שאתם לוקחים רק את החלק המסונן אם המטרה היא כוונון עדין ישיר, אחרת המודל ילמד דפוסים שגויים.

שאלות
נפוצות

האם יש במאגר תמיכה בעברית?

המאגר כולו מוגדר ומיוצר באנגלית בלבד. אין בו רשומות בעברית ולא נעשה ניסיון לייצר אילוצים לשוניים מותאמים לשפות שאינן אנגלית. כדי לקבל תוצאות דומות בעברית תצטרכו להריץ את סקריפט הייצור עם פרומפטים מקומיים.

האם מותר להשתמש במידע לצרכים מסחריים?

הרישיון מוגדר בתור רישיון מותאם אישית ולא צוין רישיון חופשי מוכר. בנוסף, המידע נוצר באמצעות מודל חיצוני שמחזיק במגבלות שימוש משלו לגבי תוצרים סינתטיים. מומלץ לבדוק את תנאי השימוש המשפטיים של המודל המייצר לפני שמשלבים את המידע בפרויקט מסחרי.

איך המידע נאסף בפועל?

הנתונים לא נאספו ממשתמשים אנושיים אלא נוצרו על ידי המודל Qwen2.5-72B-Instruct. תהליך היצירה השתמש בשיטת MagPie יחד עם הנחיות מערכת שמחקות את מבנה הבנצ'מרק של גוגל. לאחר מכן המערכת בדקה את התשובות בעזרת כלי הערכה כדי לבודד את התוצאות הנכונות.

מה ההבדל בין החלק המסונן ללא מסונן?

החלק הכללי כולל את כל הפלטים הגולמיים, כולל מקרים שבהם המודל נכשל או קיבל הוראות שאי אפשר לבצע. החלק המסונן שומר רק את הדוגמאות שקיבלו ציון הצלחה מושלם בבדיקות המחמירות. עבור אימון מודלים, מומלץ להשתמש אך ורק בחלק המסונן.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון בעזרת הפקודה load_dataset עם שם המאגר. המידע שמור בקובצי parquet מחולקים לעשרה חלקים, כך שאין צורך באישור גישה מיוחד או בהרשמה מקדימה להורדה. אפשר גם לשחזר או להריץ את כל תהליך הייצור מחדש דרך הכלי distilabel באמצעות קובץ הפקודה או הסקריפט שהועלו למאגר. הרשומות מכילות שדות מובנים כמו מילות מפתח, אילוצי שפה, מספר פסקאות, מספר מילים ותבניות מבנה נוספות שהוגדרו מראש.

from datasets import load_dataset

ds = load_dataset("argilla/ifeval-like-data")

הרישיון

הרישיון המוגדר במאגר הוא other ולא רישיון קוד פתוח סטנדרטי ומוכר. המצב הזה דורש בדיקה מעמיקה של תנאי השימוש של מודל המקור שייצר את המידע לפני שמשלבים אותו במוצר מסחרי. לא ברור לחלוטין האם מותר להשתמש בפלטים לאימון מודלים מסחריים מתחרים, ולכן אי אפשר להניח חופש שימוש מלא.

הרישיון המלא ב־Hugging Face ↗