GPT
O

open-image-preferences-v1

קוד פתוח

data-is-better-togetherapache-2.02024-11-25

  • preference
  • vlm
  • flux
  • stable-diffusion
  • synthetic

מאגר השוואות אנושיות בין זוגות תמונות שנוצרו מטקסט, שמתאים לכיוונון מודלי תמונה לפי העדפות משתמשים. הוא חוסך איסוף תיוגים ידני כשרוצים לאמן מודל תגמול או לבדוק איכות פלט מול פרומפטים מורכבים.

  • 5,125הורדות בחודש
  • 31לייקים

מה זה

המאגר כולל בין אלף לעשרת אלפים זוגות של תמונות שנוצרו על בסיס פרומפטים בדרגות קושי שונות, במטרה להעריך ולכייל מודלים של יצירת תמונה. הפרומפטים נלקחו במקור מהמאגר fal/imgsys-results, ועברו תהליך פיתוח שהרחיב את המורכבות ואת האיכות שלהם כדי לכסות קטגוריות ויזואליות נפוצות. לכל פרומפט נוצרו שתי תמונות חלופיות באמצעות מודלים שונים, כפי שניתן לראות מנתיבי התמונות שמפנים למודלים כמו SD וגרסאות פיתוח.

במקום להסתמך על ציונים אוטומטיים, היוצרים פנו לקהילה כדי שתתייג ידנית איזו תמונה עדיפה מבין השתיים עבור כל תיאור טקסטואלי. הנתונים המעובדים מסודרים בקובצי פרקט שמחולקים לעשרים וארבעה חלקים שונים, יחד עם עשרות אלפי קובצי תמונה נפרדים שמאפשרים לבחון את הוויזואליה המקורית שהוצגה למתייגים.

מתאים ל

  • אימון מודלי תגמול לתמונות

    שימוש בזוגות התמונות שנבחרו על ידי הקהילה כדי לאמן מודל שמדרג איכות פלט לפי טקסט.

  • הערכת ביצועי מודלי ייצור

    בדיקת איכות של מודל מחולל חדש מול מאגר פרומפטים מורכב שנבנה במיוחד למבחני השוואה.

  • כיול העדפות במודלי דיפוזיה

    הפעלת אלגוריתמי אופטימיזציה כמו DPO על מודלי תמונה כדי להעדיף סגנונות מועדפים על בני אדם.

איפה זה נופל

כל הפרומפטים במאגר כתובים באנגלית בלבד, כך שאין כאן שום מידע שיכול לעזור במדידת ביצועים של מודלים מול פרומפטים בעברית או בהקשרים תרבותיים מקומיים. כיוון שההעדפות נאספו מתיוג קהילתי פתוח, הטעם הוויזואלי משקף את המשתמשים שהשתתפו בפרויקט ולא מדגם מבוקר, מה שעלול לייצר הטיה סובייקטיבית כלפי סגנונות מסוימים. בנוסף, מדובר בהשוואה ישירה בין שתי תמונות ספציפיות, ללא פירוט פרמטרי של הסיבות לבחירה כמו נאמנות לטקסט לעומת אסתטיקה כללית.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי בפרויקט סגור?

כן, רישיון apache-2.0 מאפשר שימוש מסחרי מלא כולל אימון מודלים קנייניים. אין דרישה לפתוח את הקוד או את המודל שלכם, אך נדרש לשמור על מתן קרדיט והודעת הרישיון המקורית בקבצי הנתונים.

האם יש במאגר תמיכה בפרומפטים בעברית?

לא, הנתונים מוגדרים תחת השפה האנגלית בלבד וכל הפרומפטים כתובים באנגלית. כדי להשתמש בו לתרחישים בעברית תצטרכו לתרגם את הפרומפטים עצמאית או לאסוף מידע ייעודי.

איך נאספו ההעדפות בין שתי התמונות?

החוקרים הציגו למתנדבים בקהילה שתי תמונות שנוצרו עבור אותו פרומפט באמצעות מודלים שונים. כל משתתף בחר את התמונה שנראתה לו טובה יותר, והבחירות הללו קובצו לזוגות השוואה.

למה יש במאגר מעל שלושים וארבעה אלף קבצים אם יש בו פחות מעשרת אלפים רשומות?

הטבלאות עצמן שמורות בעשרים וארבעה קובצי פרקט, אך התמונות המושוות מאוחסנות כקובצי JPG בודדים בתיקיות נפרדות. המבנה הזה מגדיל מאוד את כמות הקבצים הכוללת במאגר ביחס למספר הרשומות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של Hugging Face בלי צורך בבקשת גישה מיוחדת, שכן המאגר פתוח לחלוטין. הנתונים שמורים בעשרים וארבעה קובצי parquet תחת תיקיית data, אך המאגר כולל בסך הכל מעל שלושים וארבעה אלף קבצים בגלל אחסון התמונות הנפרדות. מומלץ לוודא שיש מספיק מקום פנוי בדיסק להורדת קובצי ה־JPG לפני שמושכים את כל המאגר מקומית, או לעבוד עם הזרמת נתונים כדי לקרוא את הטבלאות בלי למשוך מראש את כל התמונות.

from datasets import load_dataset

ds = load_dataset("data-is-better-together/open-image-preferences-v1")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי ומחקרי מלא, ומאפשר לשנות את הנתונים, להפיץ אותם מחדש ולשלב אותם בפיתוחים פנימיים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית. אימון מודל על הנתונים אינו מחייב אתכם לשחרר את משקולות המודל בקוד פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗