GPT
R

RLHF-V-Dataset

קוד פתוח

openbmbcc-by-nc-4.02023-12-30

מאגר נתוני העדפה אנושית מפורטים לתמונות וטקסט. המטרה העיקרית שלו היא לאלף מודלים רב-מודאליים כדי להפחית הזיות בלי לפגוע בכמות המידע שהם מחזירים.

  • 411הורדות בחודש
  • 70לייקים

מה זה

המאגר מכיל 5,733 זוגות העדפה שנבנו על בסיס תיקונים אנושיים ברמת המקטע, סביב הוראות מגוונות שכוללות תיאורים מפורטים ושאלות ותשובות מול תמונה. הרשומות מבוססות על פלטים ממודלים חזקים כמו Qwen-VL-Chat ו־InstructBLIP, שעברו הגהה ותיקון בידי אדם כדי להבדיל בין תשובה נכונה לבין תשובה שגויה שמכילה הזיות.

מקורות התמונות הורחבו מעבר לסצנות יומיומיות פשוטות, וכוללים סגנונות מגוונים כמו יצירות אמנות מתוך WikiArt, ציוני דרך וטקסט בתוך תמונה. כל רשומה כוללת את התמונה עצמה, שאלת המשתמש, התשובה שנבחרה כטובה והתשובה שנדחתה, יחד עם מטא-דאטה שמציין מאיזה מודל הופקה התשובה המקורית ומה היה סוג השאלה.

מתאים ל

  • יישור מודל והפחתת הזיות

    אימון מודל רב-מודאלי עם RLHF לצמצום פרטים מומצאים בתיאור תמונות.

  • הערכת ביצועי ראייה-שפה

    בדיקת היכולת של מודל קיים להבדיל בין תיאור עובדתי להזיה חזותית.

  • אימון מודלי תגמול קטנים

    בניית מודל תגמול שמעניש תיאורים שגויים של פרטים בתוך תמונה.

איפה זה נופל

המאגר כולו באנגלית בלבד, ואין בו שום נתונים בעברית, כך שהוא לא יעזור ישירות ביישור שפה מקומית. היקף הדאטהסט קטן יחסית, פחות מששת אלפים רשומות, מה שמגביל את השימוש בו לכוונון עדין ממוקד ולא לאימון רחב. בנוסף, הנתונים מתמקדים אך ורק בסוגי שאלות של תיאור תמונה ומענה חזותי על שאלות שנאספו בסוף 2023 ותחילת 2024, מה שלא מכסה משימות מורכבות יותר כמו הסקת מסקנות רב-שלבית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, המאגר פורסם תחת רישיון cc-by-nc-4.0 שאוסר כל שימוש מסחרי. אם המטרה היא להוציא מוצר שמכניס כסף, אי אפשר לאמן עליו ישירות וצריך לחפש אלטרנטיבה ברישיון חופשי יותר.

האם יש בדאטהסט תמיכה בעברית?

אין במאגר עברית בכלל, והטקסטים מוגדרים וכתובים באנגלית בלבד. אם רוצים להשתמש בו למודל בעברית, תצטרכו לתרגם את השאלות והתשובות או להשתמש בו רק למודלים דו-לשוניים שמבינים אנגלית.

איך נאספו הנתונים במאגר?

החוקרים הפיקו תשובות ממודלים כמו Qwen-VL-Chat ו־InstructBLIP על תמונות מגוונות, ואז אספו תיקונים אנושיים מפורטים ברמת המקטע. התיקונים יצרו זוגות של תשובה מועדפת מול תשובה דחויה שמכילה טעויות.

במה המאגר הזה שונה ממאגרי העדפה רגילים?

רוב מאגרי ההעדפה מדרגים את כל התשובה כמקשה אחת, מה שמקשה על המודל להבין בדיוק איפה הוא טעה. המאגר הזה מתמקד בתיקונים אנושיים עדינים ברמת המקטע בתוך התשובה, מה שמסייע למנוע הזיות קטנות בסצנות מורכבות.

איך טוענים

טוענים את המאגר ישירות בספריית datasets של Hugging Face דרך פקודת load_dataset, ללא צורך באישור גישה מיוחד. המאגר נשמר בפורמט Parquet וכולל שדות של תמונה המומרת אוטומטית לפורמט PIL, שדה טקסט עם מילון של question, chosen ו־rejected, ושדות מטא-דאטה כמו שם המודל המקורי, סוג השאלה ומזהים פנימיים.

from datasets import load_dataset

ds = load_dataset("openbmb/RLHF-V-Dataset")

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שהשימוש מותר למטרות מחקר בלבד ולא לשימוש מסחרי. חובה לתת קרדיט ליוצרים, ואסור למכור את המאגר או להשתמש בו ישירות לבניית מודל מסחרי שמניב רווחים בלי להסתכן בהפרת תנאי הרישיון.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗