GPT
M

MagicBrush

קוד פתוח

osunlpcc-by-4.02023-06-14

מאגר שמספק שלשות של תמונת מקור, הוראת עריכה ותמונת יעד מתוקנת שנבנתה בידי אדם. הוא מיועד למי שמאמן מודלים לעריכת תמונות מבוססת טקסט ורוצה נתונים איכותיים ומפוקחים.

  • 10,200הורדות בחודש
  • 113לייקים

מה זה

המאגר כולל עשרת אלפים שלשות של תמונת מקור, הוראת עריכה כתובה ותמונת מטרה. התמונות מבוססות על מזהים ממאגר COCO, כאשר תמונת המקור הראשונה היא אמיתית, וכל סבב עריכה נוסף משתמש בתוצר של הסבב הקודם. כל רשומה כוללת גם מסיכה שמסמנת בלבן את האזור שבו השינוי צריך לקרות, כך שאפשר לאמן מודלים עם מסיכה או בלעדיה.

החומר מחולק לשני חלקים שזמינים להורדה ישירה. חלק האימון מכיל 8,807 סבבי עריכה שמגיעים מתוך 4,512 הפעלות עריכה נפרדות, וחלק הפיתוח כולל 528 סבבי עריכה מתוך 266 הפעלות. מערך הבחינה לא נמצא כאן כדי למנוע דליפת נתונים לאימון, וצריך לפנות למאגר המקורי כדי להשיג אותו.

מתאים ל

  • אימון מודלי עריכה

    לימוד מודלים לבצע שינויים ממוקדים בתמונות לפי הנחיה טקסטואלית ברורה.

  • עריכה מבוססת מסיכה

    שימוש במסיכות המובנות כדי להגביל את אזור השינוי ולהפחית פגיעה ברקע.

  • עריכה רב-שלבית

    אימון מודל לשמור על עקביות לאורך כמה סבבי שינויים עוקבים באותה תמונה.

איפה זה נופל

כל ההוראות נכתבו באנגלית בלבד. אם המוצר שלכם פונה לקהל ישראלי ודורש קלט בעברית, המאגר הזה לא ייתן מענה ישיר ותצטרכו לתרגם את ההנחיות או לאמן שכבת התאמה. בנוסף, המאגר לא כולל את סט הבחינה בתוכו, כך שאי אפשר להעריך מודל באופן שלם בלי לייבא נתונים חיצוניים נוספים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא cc-by-4.0 שמתיר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או פיתוח מוצרים. הדרישה העיקרית היא מתן קרדיט ברור ליוצרי המאגר.

האם המאגר כולל תמיכה בעברית?

לא. כל הוראות העריכה במאגר נכתבו באנגלית. כדי לעבוד בעברית תצטרכו לתרגם את ההוראות מראש או לחבר מודל תרגום לפני שלב העריכה.

איפה נמצא סט הבדיקה להערכת ביצועים?

סט הבדיקה אינו נמצא בקבצים שמופצים כאן. החוקרים שמרו אותו בנפרד כדי למנוע זליגת נתונים בזמן אימון מודלים, ויש לגשת למאגר הקוד שלהם בגיטהאב כדי להשיג אותו.

איך נוצרו העריכות במאגר?

מדובר בנתונים שנוצרו ותויגו ידנית על ידי בני אדם ולא בפלטים סינתטיים של מודלים. כל רשומה נבנתה עם הנחיה, תמונת מקור ותמונת תוצאה שהותאמה לה.

איך טוענים

הנתונים מגיעים בקובצי Parquet, המחולקים ל־51 קבצים עבור האימון ו־4 קבצים עבור הפיתוח. אין צורך באישור גישה ידני או בהרשמה מיוחדת כדי למשוך את הקבצים הפתוחים. השדות המרכזיים שצריך לעבד בטעינה הם source_img, target_img, instruction ו־mask_img, לצד turn_index שעוזר להבין אם מדובר בעריכה ראשונה בתמונה או בהמשך של סשן רב-שלבי.

from datasets import load_dataset

ds = load_dataset("osunlp/MagicBrush")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי ומאפשר לשנות את הנתונים ולאמן עליהם מודלים בלי לחייב שיתוף של התוצרים באותו רישיון. התנאי היחיד הוא מתן קרדיט וייחוס מתאים ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗