GPT
M

MMPR-v1.2

קוד פתוח

OpenGVLabmit2025-04-11

  • multimodal
  • reasoning
  • preference-data
  • vision-language
  • rlhf

מאגר של כשלושה מיליון דוגמאות ללימוד העדפות והסקה במודלי שפה חזותיים. הוא נבנה כדי לשפר חשיבה רב שלבית ולצמצם הזיות על תמונות.

  • 2,801הורדות בחודש
  • 42לייקים

מה זה

המאגר מכיל דוגמאות של שאלות על תמונות לצד שתי תשובות אפשריות, אחת מועדפת ואחת דחויה. המבנה נועד לטכניקות יישור והעדפה כמו אופטימיזציית העדפות מעורבת. הרשומות כוללות נתיב לתמונה, שאילתת קלט, תשובה נבחרת ותשובה פסולה.

גרסה זו מוסיפה מקורות נתונים שלא היו בגרסאות הקודמות כדי להגדיל את הגיוון. היוצרים השתמשו בפרומפטים ייעודיים לייצור הדוגמאות, והנתונים מתמקדים במשימות תפיסה, ראייה מתמטית ומענה לשאלות מורכבות על בסיס גרפיקה וטקסט. הכרטיס אינו מפרט תהליכי סינון ידניים או מחיקות ספציפיות שנעשו מעבר להוספת המקורות החדשים.

מתאים ל

  • אימון העדפות במודלי ראייה

    כוונון ישיר של מודלי שפה ותמונה בשיטות העדפה כדי לבחור תשובות נכונות ולהפחית שגיאות תפיסה.

  • שיפור ביצועים במתמטיקה חזותית

    חיזוק היכולת של מודל לפתור בעיות היגיון וגרפים בעזרת דוגמאות ממוקדות הסקה.

  • בלימת הזיות בניתוח תמונות

    שימוש בזוגות תשובות כדי לאמן מודלים לזהות במדויק מתי אובייקט לא מופיע בתמונה.

איפה זה נופל

הנתונים מוגדרים באנגלית בלבד ואין בהם תוכן בעברית. הכרטיס לא מציין בדיקות רעילות, הטיות חברתיות או סינון פרטיות מתוך מקורות התמונות. בנוסף, מודלים שמאומנים על העדפות נוטים לספוג טעויות שנוצרו בפרומפטים הסינתטיים, ולכן חובה לבדוק התאמה מול מבחני קצה מקומיים לפני שילוב בתשתיות ייצור.

אותה משפחה

MMPR יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא MIT ולכן מותר לאמן עליו מודלים מסחריים. עם זאת, היוצרים מציינים שהפרויקט כולל רכיבים חיצוניים הכפופים לרישיונות המקוריים שלהם, מה שמחייב בדיקת מקורות התמונות במערכות רגישות.

האם המאגר כולל עברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל השאלות והתשובות נכתבו באנגלית. שימוש בעברית ידרוש תרגום מראש או אימון המשך על נתונים מקומיים.

איך פותחים את קובצי התמונות להרצה?

התמונות מחולקות לחלקים נפרדים בארכיון. יש לאחד את הקבצים לקובץ אחד באמצעות פקודת cat images.zip_* אל תוך images.zip, ורק לאחר מכן לחלץ את התמונות לתיקיית העבודה.

מה מייחד את גרסה 1.2 לעומת גרסאות קודמות?

הגרסה הזו מכילה כשלושה מיליון דוגמאות ומבוססת על מקורות מידע מגוונים יותר שנוספו כדי לשפר את תוצאות ההסקה. היוצרים שחררו במקביל גם מאגר ייעודי של הפרומפטים ששימשו להרכבת הנתונים.

איך טוענים

המאגר מפורסם בגישה פתוחה וכולל שמונה קבצים, ללא צורך באישור מיוחד. קובצי התמונות מפוצלים למספר חלקים בשמות כמו images.zip_aa, images.zip_ab ו־images.zip_ac. לפני הפריסה צריך לאחד אותם לפקודת קובץ זיפ יחיד דרך שורת הפקודה ורק אז לפתוח אותו. קובצי הטקסט והתיוגים מגיעים בקובץ annotations.zip, והשדות החשובים לטעינה הם image, question, chosen ו־rejected.

from datasets import load_dataset

ds = load_dataset("OpenGVLab/MMPR-v1.2")

הרישיון

המאגר מתפרסם תחת רישיון MIT שמתיר שימוש מסחרי, עריכה והפצה, בתנאי ששומרים על הודעת זכויות היוצרים. הרישיון חל על הדאטהסט עצמו, אך הכרטיס מדגיש שחלקים מהפרויקט כוללים קוד ומודלים ממקורות חיצוניים הכפופים לרישיונות המקוריים שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗