GPT
I

Infinity-Preference

קוד פתוח

BAAIapache-2.02024-08-28

מאגר נתוני העדפות שמכוון משקולות לפי סוג המשימה, מיועד למי שרוצה לאמן או ליישר מודלי שפה על זוגות תשובות שמדורגים בהתאם להקשר הספציפי.

  • 324הורדות בחודש
  • 81לייקים

מה זה

המאגר מבוסס על מערכת תיוג היכולות של Infinity-Instruct, ומכיל 59,438 הוראות שנדגמו באופן אחיד מתוך סט ההוראות המקורי לפי סוגי משימות שונים. החוקרים ניסו לפתור בעיה מוכרת שבה העדפה אנושית משתנה לחלוטין בין משימה למשימה, ולכן התאימו את משקולות המאפיינים לכל משימה בנפרד במקום להשתמש במודל ניקוד אחיד.

לכל הוראה מוצמד זוג העדפות של תשובות שנדגמו מתוך המודל Gemma-2-9B-IT. התיוג והדירוג של הזוגות נעשו בעזרת ArmoRM בשילוב אותן משקולות ייעודיות לכל משימה. ניתוח חלוקת המשימות שבוצע באמצעות שיכוך של BGE מראה שהנתונים מכסים פיזור משימות מקביל למאגרים פתוחים מרכזיים ולמבחני הערכה מקובלים בתחום.

מתאים ל

  • יישור מודלים בשיטת SimPO

    אימון של מודלי שפה על זוגות העדפה שמכוילים לפי סוג המשימה הספציפי.

  • יצירת דאטה on-policy

    שימוש במתודולוגיה ובמשקולות המאגר כדי לייצר זוגות העדפה למודלים נוספים.

  • מחקר על משקולות העדפה

    בדיקת ההשפעה של דירוג תלוי משימה לעומת מודלי תגמול כלליים.

איפה זה נופל

אם אתם בונים מערכת בעברית, המאגר הזה לא יעזור לכם. הנתונים מוגבלים לאנגלית ולסינית בלבד. בנוסף, כל התשובות נדגמו ממודל יחיד, Gemma-2-9B-IT, והדירוג נשען על ArmoRM, כך שהטיות או שגיאות של שני המודלים האלה חילחלו ישירות פנימה. היוצרים מבהירים במפורש שהתוכן מושפע מגורמים כמו אקראיות ולכן אינם מתחייבים לדיוק הפלטים.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא. למרות שברישיון הרשמי מופיע apache-2.0, היוצרים הוסיפו סעיף הגבלה מפורש שאוסר שימוש מסחרי ומגביל את המאגר למחקר אקדמי בלבד. כל שימוש עסקי חושף אתכם לסיכון משפטי.

האם הדאטהסט כולל תמיכה בעברית?

לא, המאגר תומך אך ורק באנגלית ובסינית. אימון עליו לא יתרום ליכולות השפה של מודל בעברית ולא כולל נתונים מקומיים.

איך נאספו ונוצרו הנתונים?

נדגמו 59,438 הוראות מתוך מאגר Infinity-Instruct לפי סוגי משימות. התשובות חולצו מתוך Gemma-2-9B-IT, והדירוג בוצע באמצעות מודל התגמול ArmoRM ומשקולות ייעודיות לכל תחום.

במה הוא שונה ממאגרי העדפות רגילים?

במקום לבחון העדפה לפי קריטריון יחיד וקבוע, כאן שינו את משקולות התכונות עבור כל סוג משימה. המטרה היא להתאים את ההעדפה לאופי המשימה ולא להסתמך על מודל הערכה אחיד.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets מתוך Hugging Face, אין צורך בבקשת גישה מיוחדת או באישור ידני. הקבצים מגיעים בפורמט parquet ומחולקים לקובץ train וקובץ test, כך שהשילוב בתהליכי אימון סטנדרטיים של DPO או SimPO הוא ישיר. בפנים תמצאו את ההוראות ואת זוגות התשובות המדורגים לפי המשקולות הספציפיות.

from datasets import load_dataset

ds = load_dataset("BAAI/Infinity-Preference")

הרישיון

למרות שבמטא-דאטה מופיע רישיון apache-2.0, בהצהרת המפתחים נכתב במפורש שהמשאבים, כולל הקוד, הנתונים והמשקולות, מוגבלים למחקר אקדמי בלבד ואסורים לשימוש מסחרי. יש כאן סתירה ישירה שמסכנת כל מוצר מסחרי. מודל שתאמנו עליו יהיה חשוף לבעיה משפטית מול הדרישה הזו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗