GPT
P

PIPE

קוד פתוח

paint-by-inpaintcc-by-4.02024-06-05

המאגר מרכז זוגות תמונות עם הוראות טקסט להוספת עצמים ללא צורך במסכה ידנית. הוא מתאים למי שרוצה לאמן מודלים לעריכת תמונה לפי פקודה ישירה.

  • 3,993הורדות בחודש
  • 33לייקים

מה זה

הנתונים מבוססים על תמונות ומסכות מתוך COCO, Open Images ו־LVIS. החוקרים לקחו את תמונת המקור, מחקו ממנה עצם בעזרת מודל אינפיינטינג שמבוסס על Stable Diffusion, וכך יצרו זוג של תמונה ריקה מול תמונת יעד מלאה. בסך הכל יש כאן כמיליון זוגות תמונות וכמעט 1.9 מיליון הוראות שונות.

כל רשומה מכילה את תמונת המקור המחוקה, את תמונת היעד המקורית, מיקום העצם, ומזהים שונים. הטקסט מגיע בשלוש רמות: הוראה בסיסית של הוספת שם המחלקה, הוראה שמבוססת על מאגרי רפרנס כמו RefCOCO, והוראות מפורטות ומגוונות יותר שיוצרו באמצעות שילוב של מודל שפה חזותי ומודל שפה.

מתאים ל

  • אימון עריכה ללא מסכה

    אימון מודלים להוספת עצמים לתמונה על בסיס הוראות טקסטואליות בלבד.

  • הערכת ביצועי מודלים

    מדידת הדיוק והיכולת של מודלי עריכה באמצעות סט הבדיקה הייעודי.

  • עבודה עם הנחיות מפורטות

    בדיקת השפעת תיאורים שנוצרו על ידי מודלי שפה לעומת שמות מחלקה פשוטים.

איפה זה נופל

המאגר מתמקד אך ורק במשימה אחת, הוספת עצמים, כך שהוא לא יעזור למי שמחפש מחיקה, שינוי סגנון או עריכות מורכבות יותר. בנוסף, תמונות המקור יוצרו באמצעות מודל אינפיינטינג, מה שאומר שהן עשויות לכלול ארטיפקטים ופגמים של Stable Diffusion שעלולים לעבור למודל שלכם. כל ההוראות והמידע קיימים באנגלית בלבד על בסיס המאגרים המקוריים.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

הרישיון של המאגר הוא CC-BY 4.0, שמתיר שימוש מסחרי בכפוף למתן קרדיט. יחד עם זאת, התמונות מבוססות על מאגרים חיצוניים כמו COCO, LVIS ו־Open Images. אם אתם בונים מודל מסחרי, מומלץ לוודא שהרישיונות של מאגרי המקור הללו תואמים את הצרכים שלכם.

האם יש בדאטהסט תמיכה בעברית?

לא, אין שום תמיכה בעברית. כל ההוראות הטקסטואליות ושמות המחלקות נוצרו באנגלית בלבד. אם תרצו לאמן מודל שיבין עברית, תצטרכו לתרגם את שדות ההוראות באופן עצמאי.

איך נאספו ונוצרו הנתונים?

היוצרים השתמשו בתמונות קיימות ממאגרי סגמנטציה ידועים. הם הסירו עצמים מתוכן בעזרת מודל אינפיינטינג מבוסס Stable Diffusion כדי לייצר את תמונת הקלט, ואת ההוראות יצרו בשלוש שיטות הכוללות מודלי שפה, שמות מחלקות ומאגרי רפרנס קיימים.

במה המאגר שונה מדאטהסטים אחרים של עריכת תמונות?

הוא מתרכז באופן ספציפי בהוספת עצמים ללא צורך בציור מסכה על ידי המשתמש. בנוסף, הוא מספק כמעט 1.9 מיליון הוראות ברמות פירוט שונות לאותם זוגות תמונות, מה שמאפשר להשוות בין פקודות פשוטות להנחיות מורכבות.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets בפייתון בעזרת load_dataset לקבצי data/train-* ו־data/test-*. המאגר חופשי ואינו דורש אישור גישה מראש. הקבצים מגיעים בפורמט Parquet, כאשר סט האימון מפוצל ל־162 קבצים שונים וסט הבדיקה שמור בקובץ יחיד. השדות המרכזיים לעבודה הם source_img, target_img ושלושת שדות ההוראות השונים שמגדירים מה להוסיף.

from datasets import load_dataset

ds = load_dataset("paint-by-inpaint/PIPE")

הרישיון

המאגר מופץ תחת רישיון CC-BY 4.0 שמתיר שימוש מסחרי, שינוי והפצה, כל עוד נותנים קרדיט מתאים ליוצרים. אין חובה לשתף נגזרות תחת אותו רישיון. עם זאת, התמונות עצמן נלקחו ממאגרי COCO, LVIS ו־Open Images, ולכן לפני פיתוח מוצר מסחרי כדאי לבדוק גם את תנאי המקור של מאגרים אלה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗