GPT
O

OmniEdit-Filtered-1.2M

קוד פתוח

TIGER-Labmit2024-11-11

  • image

מאגר מסונן של מיליון ומאתיים אלף זוגות תמונות לעריכה מונחית טקסט. הוא מתאים למי שבונה מודל עריכה רב תכליתי ורוצה דוגמאות שסוננו בעזרת מודלי שפה גדולים ולא רק לפי מדדי דמיון בסיסיים.

  • 36,212הורדות בחודש
  • 131לייקים

מה זה

הרשומות במאגר מציגות תמונת מקור לצד תמונה ערוכה, מלוות בהוראות עריכה קצרות וארוכות ובסוג המשימה. התוכן מחולק לשבע משימות שונות: הוספה, הסרה, החלפה, שינוי מאפיינים, שינוי רקע, שינוי סביבה והעברת סגנון. הנתונים מתאימים ליחסי גובה רוחב שונים של תמונות.

המידע נוצר בצורה סינתטית דרך זיקוק של שבעה מודלים מומחים, כל אחד בתחומו. כדי לא לקבל זבל סינתטי, החוקרים סיננו את התוצאות באמצעות VIEScore ודגימת חשיבות שהתבססה על ציונים ממודלי שפה גדולים רב מודליים כמו GPT-4o, במקום להסתמך על CLIP-score. בכל רשומה שמורים גם ציוני עקביות סמנטית, ציון איכות תפיסתית, הציון המשוקלל הכולל, וההסברים שניתנו לציונים האלה.

מתאים ל

  • אימון מודל עריכת תמונות

    לימוד מודל יחיד לבצע מגוון פעולות כמו החלפת רקע, הוספת אובייקטים ושינוי סגנון לפי הוראות טקסט.

  • סינון לפי איכות

    שימוש בציוני האיכות וההסברים המצורפים לכל דוגמה כדי לאמן על התוצאות הטובות ביותר בלבד.

  • הערכת ביצועי עריכה

    בדיקת היכולת של מודלים קיימים לעמוד בהוראות עריכה מורכבות בעזרת סט הפיתוח המובנה.

איפה זה נופל

הטקסט כולו באנגלית, כך שאין כאן שום תמיכה בהוראות עריכה בעברית. כל הנתונים הם תוצר סינתטי של מודלים מומחים ולא תמונות אמיתיות שעברו עריכה אנושית, מה שעלול לגרור ארטיפקטים או עיוותים שהמודלים המקוריים יצרו. בנוסף, הסינון נשען על הערכות של מודלים רב מודליים, כך שההטיות שלהם לגבי מה נחשב איכותי נמצאות עמוק בתוך ציוני המאגר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מופץ תחת רישיון MIT שמתיר שימוש מסחרי חופשי, כולל אימון מודלים שיימכרו כשירות. החובה היחידה היא לצרף את תנאי הרישיון המקורי והודעת זכויות היוצרים.

האם יש במאגר תמיכה בהוראות עריכה בעברית?

לא. השפה המוגדרת במאגר היא אנגלית בלבד, וכל הוראות העריכה הקצרות והארוכות נכתבו באנגלית. אם אתם צריכים עברית, תצטרכו לתרגם את ההנחיות בעצמכם או להשתמש בנתונים חיצוניים.

מאיפה הגיעו התמונות והעריכות?

הנתונים לא נאספו מעורכים אנושיים אלא נוצרו בתהליך סינתטי על ידי שבעה מודלים מומחים, כשכל מודל טיפל במשימה ספציפית כמו שינוי סביבה או העברת סגנון. לאחר מכן הדוגמאות סוננו בעזרת VIEScore ומודלי שפה רב מודליים כדי להבטיח איכות ועקביות.

איך המאגר מאורגן מבחינת קבצים להורדה?

הנתונים מסודרים בפורמט Parquet וכוללים 572 קבצים לחלק האימון ועוד קובץ יחיד לחלק הפיתוח, בסך הכל 576 קבצים במאגר. מומלץ לוודא שיש לכם מספיק נפח דיסק פנוי ורוחב פס יציב לפני שאתם מתחילים להוריד את כל החלקים.

איך טוענים

הנתונים יושבים בקבצי Parquet שמחולקים לסט אימון של 572 חלקים וקובץ פיתוח יחיד, ללא צורך באישור גישה מיוחד. בגלל שמדובר ביותר מחמש מאות קבצים שמכילים תמונות, תצטרכו שטח אחסון משמעותי וחיבור מהיר כדי למשוך את הכל. בזמן הטעינה כדאי לשים לב לשדות התמונות src ו־edited_img, להוראות בתוך edited_prompt_list, ולשדות הציונים שמאפשרים לכם לחתוך החוצה דוגמאות שלא עומדות ברף האיכות שלכם.

from datasets import load_dataset

ds = load_dataset("TIGER-Lab/OmniEdit-Filtered-1.2M")

הרישיון

המאגר מפורסם תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. הרישיון לא מחייב אתכם לשחרר מודלים שאימנתם תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗