GPT
G

GPT-Image-Edit-1.5M

קוד פתוח

UCSC-VLAAcc-by-4.02025-07-20

  • image
  • image-editing
  • instruction-tuning
  • instruction-guided
  • multimodal

מאגר של מעל מיליון וחצי זוגות תמונות לעריכה לפי הוראות טקסט. המטרה כאן היא איכות פלט עקבית, שנבנתה כולה מחדש באמצעות GPT-Image-1.

  • 5,603הורדות בחודש
  • 89לייקים

מה זה

המאגר מאחד שלוש עבודות קודמות ומכיל 1,553,575 דוגמאות. הבסיס הגדול ביותר מגיע מתוך OmniEdit עם 1,270,385 דוגמאות, לצד 183,182 דוגמאות מתוך HQ-Edit ועוד 100,008 מתוך UltraEdit. המאפיין המרכזי הוא שכל תמונות הפלט נוצרו מחדש באמצעות GPT-Image-1 כדי לשמור על איכות אחידה, במקום להסתמך על הפלטים של המאגרים המקוריים.

מבחינת המשימות, החלוקה כוללת עריכות של הוספת אובייקט, הסרה, שינוי סגנון, החלפת רקע ועריכות מורכבות. גם רמת ההוראות מדורגת. ישנן 1,140,182 הוראות מקוריות ברמת מורכבות בסיסית ובינונית, 100,000 הוראות שנכתבו מחדש בהתבסס על התמונות החדשות, ועוד 313,393 הוראות ברמת מורכבות גבוהה שנלקחו בסגנון Complex-Edit.

בתוך HQ-Edit יש פיצול פנימי בין עריכות שהשתמשו בתמונות הקלט המקוריות, לבין תת מאגר שבו גם תמונת המקור הופקה מחדש מטקסט. ב־OmniEdit הנתונים מכסים קטגוריות כמו שינוי תכונות והחלפת אובייקטים, וב־UltraEdit הדגימה מאוזנת בין תשע קטגוריות שונות.

מתאים ל

  • אימון מודלי עריכת תמונה

    לימוד מודלים לבצע שינויים ממוקדים בתמונות על בסיס פקודות טקסט באנגלית.

  • עריכה מורכבת מרובת שלבים

    אימון על מאגר הדוגמאות ברמת C3, שדורש שינויים נרחבים בתמונה לפי הנחיה בודדת.

  • הערכת ביצועי מודלים

    בדיקת יכולת המודל במשימות מוגדרות כמו הסרת פריטים, החלפת סגנון ושינוי צבע.

איפה זה נופל

כל תמונות הפלט יוצרו באמצעות מודל יחיד, GPT-Image-1, מה שאומר שההטיות הוויזואליות ודפוסי היצירה שלו מוטמעים עמוק בתוך הדאטה. ההוראות קיימות באנגלית בלבד. אם המוצר שלכם צריך לתמוך בעברית, תצטרכו לתרגם את ההוראות או להביא נתונים מקבילים. בנוסף, קטגוריית swap של OmniEdit טרם פוצלה בין החלפת רקע להחלפת אובייקט, כך שמי שצריך תיוג מדויק יצטרך לסנן את החלק הזה לבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון שצוין הוא cc-by-4.0 שמתיר שימוש מסחרי חופשי. התנאי היחיד הוא מתן קרדיט ברור למחברי המאגר המקוריים.

האם יש בדאטהסט תמיכה בשפה העברית?

לא, כל ההוראות והתיאורים במאגר מנוסחים באנגלית בלבד. כדי לעבוד בעברית תצטרכו להוסיף שכבת תרגום או לאמן התאמה לשונית.

במה הוא שונה מ־HQ-Edit או OmniEdit המקוריים?

המאגר מאחד אותם יחד, אך ההבדל המשמעותי הוא החלפת כל תמונות הפלט בתמונות שנוצרו על ידי GPT-Image-1. המטרה הייתה להעלות את איכות העריכה ולשמור על עקביות בין המקורות השונים.

איך מאורגנות התמונות והתיוגים בקבצים?

התמונות מחולקות לפי מקורות ותיקיות קלט ופלט בתוך ארכיונים מכווצים. קובצי ה־JSON של המטא-דאטה מוחזקים במאגר אימון מקושר, והם ממפים כל מזהה לנתיבי הקבצים ולהוראות הטקסט.

איך טוענים

הנתונים מחולקים ל־215 קבצים בארכיון, ודורשים הורדה באמצעות Git LFS או סקריפט ייעודי בשם download.sh שמריץ הורדה מרובת תהליכים ישירות למחשב. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין. קבצי המטא-דאטה לא יושבים בתיקיית הבסיס אלא במאגר נפרד, וכוללים שדות לנתיב קלט, נתיב פלט, סוג המשימה, תיאור תמונת המקור וטקסט ההוראה באנגלית.

from datasets import load_dataset

ds = load_dataset("UCSC-VLAA/GPT-Image-Edit-1.5M")

הרישיון

המאגר משוחרר ברישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי שניתן ייחוס מתאים ליוצרים ולא מופעלות מגבלות משפטיות או טכנולוגיות נוספות. אין דרישה לשתף תוצרים או מודלים מאומנים תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗