GPT
U

UltraEdit

קוד פתוח

BleachNickcc-by-4.02024-06-09

  • art

זוגות תמונות שמציגים עריכה חופשית לצד הוראות טקסט ומדדי דמיון אוטומטיים. הוא מיועד למי שמאמן מודלים לביצוע עריכות ויזואליות מונחות שפה ולא רוצה לייצר דאטה סינתטי מאפס.

  • 20,706הורדות בחודש
  • 18לייקים

מה זה

כל רשומה במאגר מייצגת פעולת עריכה בודדת. המבנה מבוסס על תמונת מקור בשם source_image ותמונת תוצאה בשם edited_image, בליווי תיאורי תמונה מקבילים והוראת העריכה הספציפית בטקסט חופשי. נוסף להוראות, כל שורה כוללת חישובים מספריים של דמיון שנועדו לבקרת איכות, בהם ציוני CLIP שונים, מדד DINOv2 וערך SSIM שבוחן שמירה על מבנה התמונה המקורי.

הנתונים מחולקים למאות מקטעים נפרדים תחת השם FreeForm, כשכל מקטע מכיל בדיוק 2,000 דוגמאות ושוקל סביב 780 מגה בייט. כרטיס המאגר לא מפרט מהיכן הגיעו תמונות הבסיס, באיזה מודל השתמשו לייצור העריכות, או אילו ספי סינון הופעלו על המדדים המוצגים, כך שאי אפשר לדעת בוודאות אם יש כאן סינון אנושי או תהליך אוטומטי בלבד.

חלק מהשדות במבנה הנתונים, כמו edit_object ו־mask_image, מוגדרים כריקים לחלוטין ברמת הסכמה. המשמעות היא שהמאגר מכוון לעריכה ישירה מתמונה לתמונה לפי טקסט, ללא מסכות בידוד מובנות או חלוקה מפורשת לאובייקטים.

מתאים ל

  • אימון מודלי עריכת תמונה

    לימוד מעבר מתמונת מקור לתמונה ערוכה על בסיס הנחיה מילולית ישירה.

  • הערכת ביצועי עריכה

    בדיקת איכות של מודלים קיימים מול זוגות תמונות ומדדי דמיון מובנים.

  • סינון דאטה לפי מדדים

    בניית תתי-מאגרים איכותיים תוך שימוש בערכי SSIM וציוני CLIP קיימים.

איפה זה נופל

הטקסט והוראות העריכה קיימים באנגלית בלבד. אם המטרה היא לאמן כלי שיבין הנחיות בעברית, תצטרכו לתרגם את הפרומפטים באופן עצמאי. מעבר לכך, היעדר תיעוד לגבי מקור התמונות משאיר חוסר ודאות לגבי זכויות יוצרים של התכנים המקוריים שנדגמו. המאגר גם מציג שדות מסיכה ריקים, כך שמי שבונה מודל מבוסס Inpainting ממוקד יצטרך לחלץ מסיכות שינוי בעצמו.

אותה משפחה

UltraEdit יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לאימון מודל מסחרי?

כן, הרישיון המדווח הוא cc-by-4.0 שמתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט ברור ליוצר. עם זאת, מקור התמונות המקוריות אינו מתועד בכרטיס.

האם המאגר כולל תמיכה בעברית?

לא. שדות הטקסט, כולל תיאורי התמונות והוראות העריכה, מוגדרים באנגלית בלבד. עבודה מול משתמשים דוברי עברית תחייב תרגום חיצוני של ההנחיות.

כמה שוקל הדאטהסט והאם חייבים להוריד הכל?

המאגר מחולק למאות קבצים של כ־780 מגה בייט כל אחד, והמשקל המצטבר מגיע למאות ג'יגה בייט. אפשר בהחלט לטעון מקטעים בודדים דרך ה־API לצורך בדיקות, בלי למשוך את כל המידע מראש.

האם יש במאגר מסכות לעריכה אזורית?

לא. השדות שמיועדים למסכות ולאובייקט העריכה מוגדרים כריקים בסכמת הנתונים. המאגר מציג רק את תמונת המקור, תמונת היעד והוראת הטקסט ביניהן.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות קריאת קובצי ה־parquet המחולקים, ללא צורך בהרשמה מוקדמת או אישור גישה. בגלל שמדובר במאות מחיצות שונות המכילות תמונות מלאות, הורדה של כל המאגר דורשת נפח אחסון עצום של מאות ג'יגה בייט ורוחב פס משמעותי. שדות המפתח לעבודה הם תמונת המקור, התמונה הערוכה והוראת הטקסט, כאשר מומלץ להשתמש בציוני ה־SSIM וה־CLIP המצורפים כדי לסנן החוצה דוגמאות שבהן השינוי היה אגרסיבי או לא תואם להוראה.

from datasets import load_dataset

ds = load_dataset("BleachNick/UltraEdit")

הרישיון

המאגר מפורסם תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הדאטהסט או מודלים שאומנו עליו, בתנאי שניתן ייחוס מתאים ליוצר. אין דרישה לשתף תוצרי המשך תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗