GPT
I

ImageRewardDB

קוד פתוח

zai-orgapache-2.02023-05-21

המאגר מרכז 137 אלף השוואות אנושיות לתמונות שנוצרו מטקסט, לצד דירוגי איכות והתאמה. הוא נבנה כדי לאמן מודלי תגמול שמעריכים כמה תמונה שנוצרה באמת עונה על ההנחיה.

  • 1,643הורדות בחודש
  • 48לייקים

מה זה

כל רשומה במאגר מייצגת תמונה שחולצה מתוך DiffusionDB, ומקושרת להנחיית הטקסט המקורית שלה. מדרגים אנושיים עברו הכשרה ייעודית, השוו בין תמונות שונות שנוצרו מאותו פרומפט ודירגו אותן. לכל תמונה מוצמד נתיב הקובץ, מזהה הפרומפט, הטקסט עצמו, סיווג כללי של הנושא, ומספר התמונות הכולל שהופקו עבור אותה הנחיה.

הערכת התוכן מפורקת לשלושה ציונים מספריים: ציון כולל, ציון התאמה בין הטקסט לתמונה, וציון נאמנות שבודק האם האובייקט שנוצר שומר על מאפיינים ומבנה הגיוניים. בנוסף, כל תמונה מקבלת מיקום יחסי מול שאר התוצרים של אותה בקשה. התמונות נשמרות כקובצי WebP ללא איבוד איכות ומאורגנות בתיקיות משנה לפי חלוקה של כחמש מאות פרומפטים לכל קובץ JSON.

הנתונים מחולקים לאימון, אימות ובדיקה. בעוד שערכות האימות והבדיקה קבועות ומכילות יחד מעל חמשת אלפים תמונות, סט האימון מגיע בארבעה גדלים שונים לפי כמות הפרומפטים: 1K, 2K, 4K ועד 8K. המדרג הגדול ביותר כולל קרוב לחמישים אלף תמונות אימון שמייצרות מעל 141 אלף זוגות השוואה.

מתאים ל

  • אימון מודל תגמול לתמונות

    לימוד מודל לדרג איכות של תמונות לפי העדפת אדם, כבסיס ליישור מודלי דיפוזיה באמצעות משוב.

  • בקרת איכות של יצירת תמונות

    סינון אוטומטי של תמונות שנוצרו ומציגות עיוותים מבניים או חוסר התאמה להנחיית הטקסט המקורית.

  • הערכת ביצועי מודלי תמונה

    שימוש בסט הבדיקה הקבוע להשוואה כמותית בין גרסאות שונות של מודלי מחוללי תמונות על בסיס ציוני התאמה ונאמנות.

איפה זה נופל

כל הטקסטים במאגר הם באנגלית בלבד, ואין כאן ייצוג לעברית או לשפות אחרות. התמונות נשענות כולן על דור מודלים מסוים מתוך DiffusionDB, כך שסגנון היצירה והארטיפקטים משקפים את המודלים שהיו נפוצים בתחילת 2023. אם המודל שלכם עובד עם פרומפטים בעברית או מתמחה בריאליזם מודרני ברמה גבוהה בהרבה ממה שהיה נהוג באותה תקופה, הציונים האנושיים עלולים לתגמל מאפיינים שלא רלוונטיים לתוצרים שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר פורסם ברישיון Apache 2.0 המאפשר שימוש מסחרי מלא. אתם נדרשים לשמור על תנאי הייחוס של הרישיון המקורי בקוד ובתיעוד, אך אין חובה לחשוף את המודל שתאמנו.

כמה שוקל כל המאגר וכמה מקום צריך לפנות בדיסק?

ההורדה המלאה תופסת קרוב לעשרים וחמישה גיגה בייט. סט האימון הגדול ביותר שוקל 20.9 גיגה בייט, וקובצי הבדיקה והאימות תופסים עוד כ־2.3 גיגה בייט יחד. אם חסר לכם מקום, אפשר לטעון תת-קבוצות קטנות יותר החל מ־2.7 גיגה בייט.

האם יש במאגר תמיכה בטקסטים בעברית?

לא. כל הפרומפטים וההנחיות במאגר כתובים באנגלית בלבד. אם אתם מאמנים מודל שמיועד להבין עברית, תצטרכו לתרגם את הטקסטים או לאסוף דאטה ייעודי.

איך נוצרו הנתונים והדירוגים שבפנים?

החוקרים לקחו פרומפטים ותמונות קיימות מתוך המאגר DiffusionDB וקיבצו תמונות שנוצרו מאותו פרומפט. צוות מתייגים אנושי שעבר הדרכה ייעודית דירג את התמונות לפי קריטריונים של התאמה לטקסט ונאמנות ויזואלית, וקבע את סדר ההעדפה ביניהן.

איך טוענים

אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה דרך ספריית הנתונים של Hugging Face. בגלל שהנפח הכולל של התמונות בגרסה המלאה מגיע לכעשרים ואחד גיגה בייט בסט האימון בלבד, מומלץ להתחיל באחת הגרסאות המוקטנות. אם אתם צריכים רק את הטקסטים והציונים כדי לבחון את המבנה או לאמן מודל טבלאי, המאגר כולל קובצי Parquet נפרדים למטא-דאטה שחוסכים את הורדת קובצי ה־Zip הגדולים. השדות החשובים לחישוב הפסד והשוואה הם rank, המדרג את התמונות לאותו פרומפט, לצד image_text_alignment_rating ו־fidelity_rating שמספקים פירוק איכותי של ההחלטה.

from datasets import load_dataset

ds = load_dataset("zai-org/ImageRewardDB")

הרישיון

הנתונים משוחררים תחת רישיון Apache 2.0, והקוד תחת רישיון MIT. הרישיון חופשי ומתיר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון. אין דרישה לשתף תוצרים באותו רישיון, ומותר להשתמש במידע כדי לאמן מודלים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗