GPT
I

IF_multi_constraints_upto5

קוד פתוח

allenaiodc-by2025-06-03

המאגר מרכז הוראות מורכבות עם עד חמישה אילוצים מוגדרים במקביל לכל משימה. הוא נבנה במיוחד כדי ללמד מודלים להתמודד עם דרישות ציות קפדניות ומרובות בלי לאבד כיוון באמצע.

  • 3,270הורדות בחודש
  • 27לייקים

מה זה

מדובר בנתוני אימון מסוג IF-RLVR שמטרתם ללמד מודלים ציות להוראות מורכבות בעלות אילוצים שניתן לאמת. כל רשומה כוללת הוראה שמכילה שילוב של עד חמישה אילוצים שונים, כמו מגבלות מבנה, סגנון, אורך או פורמט מסוים. הדאטהסט מאוחסן בקובץ אימון יחיד וכולל פלטים שנוצרו על ידי מודלים של צד שלישי.

מקור האילוצים מגיע ישירות משני מאגרי הערכה מוכרים בתחום. עשרים וחמישה אילוצים נדגמו מתוך IFEval, ועוד עשרים ותשעה אילוצים נלקחו מתוך IFBench-Train. שילוב המקורות הזה מייצר משימות מבחן סינתטיות שמאתגרות את היכולת של המודל לעמוד בכללים מרובים בו זמנית, במקום לבדוק רק משימה פשוטה עם דרישה בודדת.

המפרסמים מבית AllenAI לא פירטו בכרטיס את הליך הסינון המדויק או אופן החלוקה לשדות ספציפיים בתוך הרשומות. ידוע רק שהרשומות מרכזות את ההוראות והתוצרים שנועדו לאימון מבוסס חיזוקים מול אילוצים ברורים.

מתאים ל

  • אימון לציות לאילוצים

    אימון מודלים לעמידה בעד חמישה חוקים במקביל באותה תשובה.

  • מחקר על RLVR

    פיתוח ובדיקת אלגוריתמים של למידת חיזוק עם אימות חוקים מוגדר.

  • הערכת עמידה בהנחיות

    בדיקת יכולת המודל לעמוד בדרישות שנלקחו מ־IFEval ו־IFBench.

איפה זה נופל

הכרטיס קצר במיוחד ולא מפרט הטיות, שפות, או חלוקת גדלים. הנתונים כוללים תוצרים ממודלים של צד שלישי, כך שקיימת תלות באיכות המודלים שיצרו אותם ובמגבלות שלהם. אין מידע על תמיכה בעברית, ולפי המקורות שמבוססים על IFEval סביר להניח שהכל באנגלית. אם אתם בונים מוצר בעברית, תצטרכו לבדוק את הטקסטים ידנית לפני שתכניסו אותם לתהליך עבודה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הבסיסי הוא ODC-BY, אבל המפרסמים מציינים שהוא מיועד למחקר וחינוך. בנוסף, יש בפנים פלטים ממודלים של צד שלישי שכפופים לתנאים שלהם. לא הייתי משתמש בזה לאימון מודל מסחרי לפני בדיקת התנאים של אותם מודלים.

האם הדאטהסט כולל טקסטים בעברית?

הכרטיס לא מציין שפות כלל. האילוצים נלקחו ממאגרים כמו IFEval ו־IFBench-Train, שהם באנגלית, ולכן קרוב לוודאי שאין כאן עברית. תצטרכו לתרגם את המשימות או לבנות דוגמאות משלכם אם היעד הוא עברית.

מאיפה הגיעו הנתונים שבמאגר?

האילוצים מבוססים על 25 אילוצים מ־IFEval ועוד 29 מ־IFBench-Train. התשובות וההוראות עצמן נוצרו בעזרת מודלים של צד שלישי כחלק ממחקר של חוקרי AllenAI על הכללת ציות להוראות.

איך בנוי המאגר בפועל?

יש בו קובץ אימון יחיד בפורמט parquet, בלי פיצול מובנה לולידציה או טסט. הכרטיס לא מציג דוגמה לרשומה, ולכן תצטרכו לטעון אותו ולבדוק את מבנה השדות בעצמכם.

איך טוענים

אתם מושכים את הנתונים ישירות דרך הספרייה של Hugging Face בלי צורך באישור גישה מיוחד. המאגר פתוח וכולל קובץ בודד בפורמט parquet בשם data/train-00000-of-00001.parquet לצד קובץ התיעוד. לפני שאתם מתחילים להריץ אימון, תצטרכו לפתוח את הקובץ ולבדוק את מבנה השדות הפנימי, מאחר שכרטיס המאגר לא מפרט את שמות העמודות או סכמת הנתונים.

from datasets import load_dataset

ds = load_dataset("allenai/IF_multi_constraints_upto5")

הרישיון

הרישיון הוא ODC-BY 1.0, שדורש מתן קרדיט ליוצרים. המאגר מיועד לפי התיעוד לשימוש מחקרי וחינוכי בכפוף להנחיות של Ai2. נקודה קריטית היא שהדאטהסט מכיל פלטים ממודלים של צד שלישי, ואלה כפופים לתנאי שימוש נפרדים שיכולים להגביל את השימוש המסחרי בתוצרים ובמודלים שתאמנו עליהם.

הרישיון המלא ב־Hugging Face ↗