GPT
C

CrispEdit-2M

קוד פתוח

WeiChowcc-by-4.02025-09-22

  • image
  • image-editing
  • instruction-tuning
  • instruction-guided
  • multimodal

מעל שני מיליון זוגות תמונות לעריכה מונחית, בחלוקה לשבע משימות מוגדרות מראש. מתאים למי שרוצה לאמן מודלים על פעולות עריכה ספציפיות כמו הוספה, הסרה ושינוי צבע.

  • 16,503הורדות בחודש
  • 17לייקים

מה זה

המאגר מכיל 2,241,000 דוגמאות שמיועדות לאימון והערכה של מודלים לעריכת תמונה, ונבנה סביב המחקר של EditMGT. הוא מחולק לשבע קטגוריות ברורות של עריכה, שמופרדות לפי שמות הקבצים: שינוי צבע עם 496 אלף דוגמאות, שינוי סגנון עם 400 אלף, החלפת אובייקטים עם 391 אלף, הסרת אובייקטים עם 347 אלף, הוספת אובייקטים עם 303 אלף, שינוי רקע עם 272 אלף, ושינוי תנועה עם 32 אלף דוגמאות בלבד.

הנתונים שמורים בקובצי פרקט, כשבכל קובץ יש בדיוק 256 רשומות, ויש כמעט תשעת אלפים קבצים כאלה. הכרטיס לא מפרט מאיזה מקורות הגיעו התמונות המקוריות ואיך בוצע הסינון שלהן בפועל.

מתאים ל

  • אימון מודל החלפת אובייקטים

    שימוש בקטגוריית replace כדי ללמד מודל להחליף פריט ספציפי בתוך תמונה בלי לפגוע בשאר הרקע.

  • הסרת אלמנטים מהתמונה

    אימון על תת המאגר remove למשימות של השלמת תמונה ומחיקת אובייקטים לפי הנחיה.

  • בנצ'מרק להערכת מודלי עריכה

    בדיקת ביצועים של מודלים קיימים לפי שבע הקטגוריות כדי לראות איפה הם נכשלים.

איפה זה נופל

הטקסטים וההנחיות מוגדרים באנגלית בלבד, כך שאין כאן תמיכה בעברית או בהקשרים מקומיים. המשימות אינן מאוזנות, למשל שינוי תנועה כולל רק 32 אלף דוגמאות לעומת כמעט חצי מיליון בשינוי צבע. בנוסף, הכרטיס שותק לגבי איכות התמונות, אופן יצירת העריכות או הטיות בתוכן המקורי, ולכן חייבים לדגום ידנית לפני שמאמנים מוצר.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון הוא CC-BY-4.0 והוא מתיר שימוש מסחרי מלא. הדרישה היחידה היא מתן ייחוס מתאים ליוצרי המאגר.

האם יש במאגר הנחיות או נתונים בעברית?

לא. המאגר מתועד ומוגדר באנגלית בלבד, וכל המשימות בנויות בשפה זו.

איך מחולקות המשימות במאגר?

יש שבע משימות שונות שמזוהות לפי קידומת הקובץ, כולל הוספה, הסרה, החלפה, שינוי צבע, רקע, סגנון ותנועה. כל קובץ פרקט מכיל 256 דוגמאות ששייכות לאותה קטגוריה.

האם חייבים להוריד את כל שני מיליון הפריטים?

לא חובה. מכיוון שהקבצים מחולקים לפי סוג המשימה בקידומת השם, אפשר לטעון ולהוריד רק את הקבצים של המשימה שמעניינת אתכם.

איך טוענים

טוענים אותו ישירות דרך הספרייה הרגילה של Hugging Face עם load_dataset. אין צורך בבקשת גישה או אישור מיוחד, המאגר פתוח לחלוטין להורדה.

קחו בחשבון שיש כאן 8,973 קובצי פרקט שמכילים מיליוני תמונות, כך שזה דורש נפח אחסון משמעותי ותעבורת רשת רצינית אם מורידים הכל מקומית. כדאי לסנן לפי קידומת הקובץ אם אתם צריכים רק משימה אחת ולא את כל השבע.

from datasets import load_dataset

ds = load_dataset("WeiChow/CrispEdit-2M")

הרישיון

הרישיון הוא CC-BY-4.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולאמן עליו מודלים חופשי, בתנאי שנותנים קרדיט ראוי למחברים. אין דרישה לשתף תוצרים או מודלים באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗