GPT
O

open-image-preferences-v1-binarized

קוד פתוח

data-is-better-togetherapache-2.02024-12-04

מאגר של זוגות תמונות מיוצרות עם העדפות אנושיות על בסיס פרומפטים מגוונים. הוא מיועד למי שמפתח מודלי יצירת תמונה וצריך לכוונן אותם או להעריך את איכות התוצאות.

  • 252הורדות בחודש
  • 59לייקים

מה זה

המאגר כולל עשרת אלפים זוגות של תמונות שנוצרו מטקסט, כשלכל זוג מוצמדת העדפה שנבחרה על ידי אנשים מתוך הקהילה. הבסיס לכל העסק הוא פרומפטים שנלקחו ממאגר חיצוני בשם fal/imgsys-results. הפרומפטים האלה עברו פיתוח ועיבוד לפי רמות מורכבות ואיכות שונות כדי לכסות קטגוריות תמונה נפוצות, החל מסגנון אנימה ועד פיקסל ארט.

המטרה המרכזית כאן הייתה להציב שתי תמונות שונות זו לצד זו מול אותו פרומפט, ולתת לאנשים להחליט איזו תוצאה טובה יותר. לפי כרטיס המאגר, המידע עבר המרה למבנה בינארי שמתאים ישירות לאימון העדפות. הנתונים מאורגנים בחלוקה לספליט אימון יחיד שמחולק לחמישה קבצי פארקט שונים, ללא חלוקה מובנית מראש לקבוצת בדיקה או אימות נפרדת.

מתאים ל

  • אימון מודל העדפות

    אימון של Reward Model עבור שיטות כוונון כמו DPO או RLHF במודלי יצירת תמונה מטקסט.

  • הערכת איכות מחוללים

    בדיקה השוואתית של מודלי תמונה חדשים מול העדפות אנושיות מגוונות על פני קטגוריות שונות.

  • סינון פרומפטים למחקר

    ניתוח הפרומפטים המורכבים במאגר כדי להבין איזה סגנונות מייצרים פערים משמעותיים בין תמונות.

איפה זה נופל

הכרטיס מציג תיוג של קהילה, אבל לא מפרט מי האנשים שתייגו, מה היו הקריטיונים להעדפה, או איך פתרו מקרים שבהם הבודקים לא הסכימו ביניהם. הפרומפטים מבוססים על אנגלית בלבד ולכן אין כאן שום כיסוי לעברית או להקשרים מקומיים. בנוסף, חסר פירוט מלא של המודלים המדויקים שייצרו כל תמונה בזוגות, מה שמקשה לדעת אם יש כאן הטיה מובנית לטובת ארכיטקטורה ספציפית. תצטרכו לדגום ידנית את הזוגות לפני השימוש כדי לוודא שאיכות התיוג עומדת בסטנדרטים שלכם.

שאלות
נפוצות

האם המאגר מתאים לעבודה בעברית?

הפרומפטים במאגר מופיעים באנגלית בלבד ומבוססים על דאטהסט חיצוני באנגלית. אם אתם בונים מודל שמיועד לפרומפטים בעברית, המאגר הזה לא יספק לכם דוגמאות מתאימות בלי שתתרגמו אותן קודם. גם אז, התמונות נוצרו במקור על בסיס הטקסט האנגלי.

מותר להשתמש בנתונים האלה לפרויקט מסחרי?

כן, המאגר מפורסם תחת רישיון apache-2.0 שמאפשר שימוש מסחרי מלא ללא תשלום. תצטרכו רק לשמור על תנאי הייחוס של הרישיון ולציין את המקור. אין מניעה למכור מוצרים שמבוססים על מודלים שאומנו על המידע הזה.

איך נאספו ההעדפות בין התמונות?

היוצרים לקחו פרומפטים ממאגר קיים, פיתחו אותם לפי רמות קושי, ויצרו שתי תמונות עבור כל אחד מהם. לאחר מכן הם פנו לקהילה וביקשו ממשתמשים לסמן איזו תמונה מבין השתיים עדיפה בעיניהם. התהליך הזה הניב עשרת אלפים זוגות מתויגים.

איך הנתונים מאורגנים בתוך המאגר?

כל המידע מרוכז בתיקיית דאטה אחת שמכילה חמישה קבצי parquet עבור קבוצת האימון. המבנה הוא בינארי, כלומר שתי חלופות של תמונה מול פרומפט עם סימון הבחירה המועדפת. אין חלוקה מובנית מראש לקבוצת ולידציה או מבחן, ואת הפיצול תצטרכו לעשות בעצמכם.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets הרגילה של Hugging Face בלי צורך באישור גישה מוקדם או בטוקן מיוחד, כי המאגר פתוח לחלוטין לציבור. כל המידע שמור בחמישה קבצי parquet תחת תיקיית data, בפורמט binarized שמסדר את הנתונים לצמד של בחירה מובילה מול בחירה נדחית.

בזמן הטעינה תצטרכו להביא בחשבון את הטיפול בתמונות עצמן, בין אם הן מוטמעות ישירות בקבצים כבתים ובין אם הן נמשכות מכתובות מקוריות ברשת. כדאי להגדיר תהליך מקדים שמפרק את הפארקט ובודק את שדות הפרומפטים וההעדפות לפני שמעבירים אותם לתהליך הכוונון של המודל.

from datasets import load_dataset

ds = load_dataset("data-is-better-together/open-image-preferences-v1-binarized")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של המידע והפצה שלו הלאה. אתם לא חייבים לשתף את התוצרים שלכם באותו רישיון, אבל כן נדרש לתת קרדיט נאות ליוצרים ולכלול עותק של הרישיון וכתב הוויתור המקורי בכל הפצה של הנתונים. מודלים שתאמנו על בסיס המאגר הזה מותרים לשימוש מסחרי מלא.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗