GPT
T

tulu-3-sft-personas-instruction-following

קוד פתוח

allenaiodc-by2024-10-30

המאגר מרכז כמעט שלושים אלף הוראות סינתטיות עם אילוצים מוגדרים. הוא מיועד למי שרוצה לאמן מודל להישמע להנחיות קשיחות בלי לסטות מהחוקים שהגדרתם לו.

  • 19,646הורדות בחודש
  • 68לייקים

מה זה

מכון אלן לבינה מלאכותית יצר את המאגר הזה כדי ללמד מודלים להתמודד עם דרישות מורכבות. יש כאן 29,980 דוגמאות שנבנו בצורה סינתטית לחלוטין. השיטה שלהם מרחיבה מחקר של גה ושותפיו מיוני 2024 באמצעות שימוש בפרסונות שונות, מה שמייצר גיוון רחב יותר של סגנונות כתיבה ובקשות מצד המשתמש, במקום ניסוחים שחוזרים על עצמם.

כל רשומה בנויה סביב אילוצים שנלקחו מתוך הטקסונומיה של מאגר IFEval. מדובר בדרישות שניתן לבדוק באופן חד משמעי, כמו מגבלות מבנה, אורך או פורמט. המבנה הפנימי מכיל מזהה ייחודי, את ההוראה עצמה, רשימה של עד שלושה אילוצים שחייבים להתקיים, ואת מערך ההודעות שכולל את פניית המשתמש ותשובת העוזר שמתאימה ישירות לאימון מונחה.

מתאים ל

  • אימון להתאמה לפורמט

    לימוד מודלים לענות במבנה קשיח לפי חוקים מוגדרים מראש.

  • שיפור ביצועי IFEval

    הכנת מודל למבחני עמידה באילוצים ובדיקות ציות טכניות.

  • אימון מונחה מגוון

    חשיפת מודל לפרסונות שונות של משתמשים כדי למנוע ניסוחים אחידים.

איפה זה נופל

הנתונים כולם באנגלית, בלי אף מילה בעברית, כך שהוא לא יעזור ישירות לשיפור שפה מקומית. בנוסף, מדובר בדאטה סינתטי לחלוטין שמבוסס על אילוצי IFEval בלבד. הוא לא בודק עובדות בעולם האמיתי, אלא רק ציות לחוקים טכניים, ולכן מודל שמתאמן עליו עלול להתמקד בפורמט על חשבון תוכן מהותי.

שאלות
נפוצות

האם מותר להשתמש בזה למטרות מסחריות?

כן, רישיון ODC-BY מאפשר שימוש מסחרי מלא. הדרישה היחידה היא לתת קרדיט למכון אלן בכל הפצה או תוצר שמבוסס על הנתונים.

האם המאגר כולל תוכן בעברית?

לא. כל 29,980 הדוגמאות נכתבו באנגלית בלבד. אם אתם מכוונים למודל עברי, תצטרכו לתרגם את הנתונים או לייצר סט אילוצים ייעודי.

איך נאסף המידע שבפנים?

הנתונים לא נלקחו משיחות אמיתיות, אלא יוצרו באופן סינתטי. החוקרים השתמשו בפרסונות מגוונות והצמידו להן אילוצים מובנים שנלקחו מהמחקר של IFEval.

מה ההבדל בין זה לבין סטים רגילים של הוראות?

רוב סטי ההוראות מתמקדים בשיחה כללית או במענה על שאלות. כאן הדגש הוא על עמידה באילוצים מדידים, בין אחד לשלושה בכל דוגמה, שמחייבים את המודל לדיוק במבנה.

איך טוענים

טוענים אותו בשורה אחת דרך הספרייה הרגילה של Hugging Face בלי צורך באישור גישה מראש. הקובץ מגיע בפורמט Parquet יחיד שמכיל את כל רצועת האימון, כך שההורדה פשוטה ומהירה. בזמן עיבוד הנתונים, שימו לב לשדה constraints שמפרט בדיוק מה נדרש מהתשובה, ולשדה messages שבו מונח הדיאלוג המלא שמתאים ישירות לתהליכי אימון.

from datasets import load_dataset

ds = load_dataset("allenai/tulu-3-sft-personas-instruction-following")

הרישיון

המאגר מופץ תחת רישיון ODC-BY. מותר להשתמש בו לצרכים מסחריים ולאמן איתו מודלים חופשי, בתנאי שאתם נותנים קרדיט ברור למכון אלן כיוצרי המאגר. הרישיון לא דורש מכם לשתף את המודל שלכם תחת אותו היתר.

הרישיון המלא ב־Hugging Face ↗