GPT
V

v1.0

קוד פתוח

mulan-datasetcc-by-nc-sa-4.02024-03-28

  • decomposition
  • RGBA
  • multi-layer
  • COCO
  • LVIS

המאגר מציע פירוק של תמונות לשכבות RGBA נפרדות יחד עם תיאורי טקסט. הוא מתאים למי שחוקר יצירת תמונות מטקסט עם שליטה על אובייקטים והסתרות.

  • 5,801הורדות בחודש
  • 27לייקים

מה זה

המאגר מחולק לשני תתי מאגרים עיקריים, MuLAn-COCO ו־MuLAn-LAION, ומכיל מעל 44K אנוטציות רב שכבתיות של תמונות RGB ומעל 100K תמונות של מופעים בודדים. המידע מבוסס על תמונות מתוך COCO 2017 בשילוב LVIS, ועל תמונות מתוך LAION Aesthetic v2 6.5+. המטרה שלו היא לספק פירוק של אובייקטים ומידע על הסתרות עבור תמונות פוטו-ריאליסטיות.

המבנה של כל רשומה כולל קובץ pickle שמכיל מסכות של הרקע והמופעים, השלמות של אזורים מוסתרים באמצעות אינפיינטינג, וערוצי אלפא של האובייקטים. בנוסף מצורפים תיאורי טקסט שנוצרו על ידי LLaVA ו־BLIP 2, לצד פרטי מודל של CLIP.

מתאים ל

  • הוספת מופעים לתמונה

    אימון מודלים כמו InstructPix2Pix להוספת שכבות של אובייקטים ספציפיים לתמונה קיימת.

  • יצירת תמונות RGBA

    כוונון מודלים כמו StableDiffusion v1.5 ליצירת אובייקטים מבודדים עם ערוץ שקיפות.

  • עריכת תמונות מבוססת שכבות

    פיתוח כלים שמפרידים ומבודדים רקע ממופעים כדי לשלוט בהסתרות ובקומפוזיציה.

איפה זה נופל

הנתונים כוללים טקסט באנגלית בלבד ואין בהם עברית. תיאורי ה־LLaVA חסרים לחלוטין עבור מופעים בודדים וקיימים רק לרקע ולתמונה הכוללת, כך שמופעים נשענים רק על BLIP 2. בנוסף, תהליך שחזור השכבות תלוי בהורדה חיצונית של תמונות מקור מקישורים שעלולים להישבר, ומסתמך על השלמות מלאכותיות של אינפיינטינג ולא על מידע צילומי אמיתי מאחורי האובייקטים.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

לא. הרישיון הוא cc-by-nc-sa-4.0, והוא אוסר במפורש שימוש מסחרי מכל סוג שהוא. הוא מתאים למחקר אקדמי ולניסויים פנימיים בלבד.

האם מקבלים את התמונות המפורקות מוכנות להורדה?

לא, המאגר מספק בעיקר קובצי אנוטציות כדי לכבד רישיונות מקור. צריך להוריד את תמונות הבסיס מ־COCO ומקישורי LAION, ואז להריץ סקריפט פייתון שמשחזר את השכבות לקובצי תמונה.

האם יש תמיכה בעברית?

אין במאגר עברית כלל. כל התיאורים והנתונים הטקסטואליים שנוצרו על ידי המודלים מוגדרים באנגלית בלבד.

מה מייחד אותו ממאגרי תמונות רגילים כמו COCO?

הוא לא מספק רק תמונה ומסכה שטוחה, אלא פירוק לשכבות RGBA מלאות של הרקע והאובייקטים. השכבות כוללות השלמה של אזורים מוסתרים באמצעות אינפיינטינג יחד עם תיאורי טקסט ייעודיים לכל שכבה.

איך טוענים

אי אפשר פשוט למשוך תמונות מוכנות. המאגר מופץ כקבצי rar מפוצלים שצריך לחלץ באמצעות unrar, והוא כולל 361 קבצים במאגר. בגלל ענייני רישוי, מקבלים בעיקר אנוטציות בפורמט p.zl, קישורים בקובץ csv עבור תמונות LAION, ואת תמונות COCO צריך להוריד מראש מחלוקות האימון והוולידציה.

לאחר מכן בונים קובץ csv שמקשר בין התמונה לאנוטציה ומריצים את הסקריפט dataset_decomposition.py בסביבת conda ייעודית. הסקריפט משתמש ב־joblib כדי להרכיב את שכבות ה־RGBA ומייצר עומס כבד על המעבד והדיסק.

from datasets import load_dataset

ds = load_dataset("mulan-dataset/v1.0")

הרישיון

הרישיון המדווח הוא cc-by-nc-sa-4.0. המשמעות היא שאסור לחלוטין להשתמש במאגר לצרכים מסחריים או להכניס אותו למוצר מניב רווח. חובה לתת קרדיט ליוצרים, וכל נגזרת או עבודה שמבוססת עליו חייבת להיות מופצת תחת אותו הרישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗