GPT
R

RLAIF-V-Dataset

קוד פתוח

openbmbcc-by-nc-4.02024-05-19

  • multimodal
  • feedback
  • preference-alignment
  • mllm

המאגר מרכז מעל 83 אלף זוגות העדפה חזותיים לאימון מודלי ראייה. הוא מיועד למי שרוצה לצמצם הזיות ולחזק אמינות של מודל רב-מודאלי בלי להפיק משוב אנושי יקר.

  • 2,927הורדות בחודש
  • 219לייקים

מה זה

המאגר כולל בדיוק 83,132 זוגות העדפה שמיועדים לאימון מודלים רב-מודאליים בשיטות כמו DPO או RLHF. כל רשומה מורכבת מתמונה, שאלת קלט, תשובה מועדפת ותשובה שנדחתה. המבנה הזה מאפשר למודל ללמוד איך להימנע מהזיות בתיאור תמונות או במענה על שאלות חזותיות.

ההוראות והתמונות לא נוצרו מאפס אלא נאספו ממקורות מבוססים, ביניהם MSCOCO, ShareGPT-4V, MovieNet, Google Landmark v2, VQA v2, OKVQA ו־TextVQA. בנוסף שולבו פרומפטים מפרויקט RLHF-V שמייצרים תיאורי תמונה מפורטים וארוכים. המטא-דאטה בכל שורה מפרט מהיכן הגיעה הדגימה, אילו מודלים ייצרו את התשובות, איזה מודל שימש כשופט ואיזה סוג שאלה נבדק.

מתאים ל

  • אימון DPO רב-מודאלי

    כוונון מודלי שפה וראייה על זוגות של תשובה נכונה מול שגויה כדי לשפר את איכות המענה.

  • הפחתת הזיות בתיאור תמונה

    אימון המודל לזהות פרטים ויזואליים מדויקים ולהימנע מהמצאת אובייקטים שלא מופיעים.

  • מחקר על משוב סינתטי

    בדיקת היעילות של משוב ממודלי שפה גדולים לעומת מתייגים אנושיים במשימות ראייה ממוחשבת.

איפה זה נופל

הנתונים כולם באנגלית, בלי שום כיסוי לשפות אחרות, כך שלאימון מודל בעברית הוא לא יעזור באופן ישיר. הפידבק כולו מבוסס בינה מלאכותית ולא מתייגים אנושיים, כך שהטיות של המודלים המדרגים עלולות לחלחל פנימה. בנוסף, מגוון התמונות מוגבל למאגרי המקור הקיימים וכולל בעיקר צילומי אינטרנט כלליים, אתרים מפורסמים וסרטים. אם המערכת שלכם עובדת על מסמכים סרוקים, תצלומי אוויר או ממשקי משתמש, הכיסוי כאן יהיה חלקי מאוד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC 4.0 שמונע מפורשות כל שימוש מסחרי. מודל שאומן על הנתונים האלה מוגבל למחקר בלבד ולא ניתן למכור גישה אליו.

האם המאגר כולל תוכן בעברית?

לא, כל השאלות והתשובות מוגדרות באנגלית בלבד. אם המטרה היא מודל רב-מודאלי בעברית, תצטרכו לתרגם את השאלות והתשובות או להשתמש במאגר אחר.

איך נאספו ההעדפות בתוך הדאטהסט?

הטקסטים נוצרו על ידי מודלי שפה וראייה והדירוג נקבע על ידי מודל בינה מלאכותית שבדק אמינות. התמונות עצמן נלקחו ממאגרים ציבוריים מוכרים כמו MSCOCO ו־Google Landmark v2.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה של Hugging Face עם הפקודה load_dataset על openbmb/RLAIF-V-Dataset. אין צורך לבקש אישור גישה מראש והנתונים פתוחים להורדה. המאגר מחולק לקובצי parquet, כשלפחות שבעה מהם מכילים את הדאטה עצמו ומחזיקים את התמונות בפורמט בתים יחד עם הנתיב שלהן. השדות המרכזיים לעבודה הם image שממיר ישירות לאובייקט תמונה, question, ושני שדות הטקסט chosen ו־rejected שמרכיבים את צמד ההעדפה.

from datasets import load_dataset

ds = load_dataset("openbmb/RLAIF-V-Dataset")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0. המשמעות ברורה וחדה, אסור להשתמש בנתונים למטרות מסחריות בשום צורה. מותר לחקור, ללמוד ולאמן מודלים לצרכים אקדמיים תוך מתן קרדיט ליוצרים, אבל מודל שמאומן על הדאטהסט הזה לא יוכל להיכנס למוצר מסחרי או לשירות שנמכר ללקוחות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗