GPT
C

ConceptEdit-12M

קוד פתוח

inclusionAIapache-2.02026-08-17

  • image-editing
  • instruction-based-editing
  • multimodal
  • computer-vision
  • image-generation

מאגר ענק לעריכת תמונות מונחית הוראות טקסט, המבוסס על שלשות של מקור, יעד ומטא-דאטה מפורט. הוא מתאים למי שמאמן מודלים ומחפש פיקוח הדוק עם בדיקות איכות מובנות.

  • 24,039הורדות בחודש
  • 46לייקים

מה זה

כל רשומה במאגר בנויה כשלישייה הכוללת תמונת מקור בפורמט JPG, תמונת יעד ערוכה בפורמט PNG, וקובץ JSON תואם. תמונות המקור מבוססות על המאגר Fine-T2I. קובץ המידע כולל תיאור של פעולת העריכה, הוראות טקסטואליות באנגלית ובסינית, ונתוני בקרת איכות במבנה של שאלות ותשובות ויזואליות שבודקות האם העריכה הצליחה.

התוכן מחולק לארבעה חלקים עיקריים לפי סוג הפרומפט והרזולוציה. ישנם חלקים עם פרומפטים מורחבים ברזולוציה מרובעת או אקראית, וחלקים עם הפרומפטים המקוריים באותן שתי תצורות רזולוציה. בסך הכל הנתונים ארוזים בתוך 616 קובצי ארכיון מסוג tar, המחולקים בין ארבעת החלקים הללו.

מתאים ל

  • אימון עריכת תמונה מטקסט

    לימוד מודלים לבצע שינויים ממוקדים בתמונות על בסיס הנחיות טקסטואליות באנגלית או בסינית.

  • בקרת איכות לעריכות

    שימוש במטא-דאטה של ה־VQA כדי לסנן דוגמאות פחות מדויקות ולשפר את יציבות האימון.

  • הערכת ביצועי עריכה

    בדיקת יכולת המודל לעמוד בהוראות קצרות לעומת מפורטות ברזולוציות מרובעות או משתנות.

איפה זה נופל

הטקסטים וההוראות זמינים רק באנגלית ובסינית, ללא תמיכה בעברית. אם המטרה היא מודל שמבין הנחיות בעברית, תצטרכו לתרגם את ההוראות בעצמכם. בנוסף, מדובר בעריכות סינתטיות שנוצרו על גבי תמונות קיימות, כך שאיכות התוצאות תלויה בסינון ה־VQA המצורף. הכרטיס אינו מציין את המשקל הכולל של הקבצים בגיגה-בייט לפני ההורדה, ולכן נדרש לבדוק מראש שיש מספיק שטח דיסק לפריקה של מאות קובצי ארכיון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא Apache 2.0, שמתיר שימוש מסחרי, שינוי והפצה של הנתונים. עליכם רק לספק ייחוס מתאים ליוצרים המקוריים ולצרף עותק של הרישיון. זה חל גם על מודלים שתאמנו על בסיס המאגר הזה.

האם המאגר כולל תמיכה בהוראות בעברית?

לא, המאגר כולל הנחיות וטקסטים בשתי שפות בלבד: אנגלית וסינית. כדי להשתמש בו לאימון מודל שמבין עברית, תידרשו לתרגם את שדות ההוראות באופן עצמאי. שאר המטא-דאטה, כולל שאלות הבקרה, כתוב גם הוא בשפות אלו בלבד.

מאיפה הגיעו תמונות המקור ואיך בוצעה בקרת האיכות?

תמונות המקור מבוססות על המאגר הציבורי Fine-T2I. לכל תמונה ערוכה צורף מטא-דאטה של בקרת איכות מסוג VQA שבדק האם העריכה הצליחה, כמה שגיאות נמצאו, והאם מומלץ לשמור את הדגימה באמצעות דגל ייעודי.

באיזה מבנה מגיעים הקבצים להורדה?

המאגר ארוז ב־616 קובצי tar שונים המחולקים לארבעה חלקים לפי סוג ההוראה והרזולוציה. כל קובץ ארכיון מכיל תיקיית אצווה ובה שלשות של קובץ מקור, קובץ ערוך וקובץ JSON. הנתיבים בתוך קובצי המידע הם יחסיים ומפנים ישירות לתמונות שבאותה אצווה.

איך טוענים

הנתונים פתוחים להורדה ישירה ללא צורך באישור גישה, אך מדובר במאות קובצי tar שמחייבים פריקה ידנית ותופסים נפח אחסון משמעותי. כל קובץ כזה מכיל תיקיית אצווה עם השלשות התואמות לפי מזהה דגימה. בתוך קובצי ה־JSON הנתיבים לתמונות הם יחסיים, מה שמקל על טעינה מקומית. לפני שרצים לאמן, כדאי לשים לב לשדה evaluation, שכולל ציון איכות כולל ודגל keep, שמאפשרים לסנן החוצה דוגמאות שלא עברו בהצלחה את בדיקות העריכה.

from datasets import load_dataset

ds = load_dataset("inclusionAI/ConceptEdit-12M")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב שיתוף של מודלים מאומנים תחת אותו הרישיון. התנאי המרכזי הוא מתן ייחוס מתאים ליוצרים ושמירה על הודעות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗