GPT
X

X2Edit-Dataset

קוד פתוח

OPPOerapache-2.02025-08-07

מאגר ענק לעריכת תמונות מונחית הוראות שמכסה 14 משימות שונות. הוא מתאים למי שמאמן מודלים ומחפש נתונים שנוצרו וסוננו דרך מודלים חזקים כמו Kontext, Step1X ו־Qwen.

  • 4,534הורדות בחודש
  • 20לייקים

מה זה

המאגר כולל מיליוני צמדי תמונות והוראות עריכה שנוצרו באמצעות שרשרת מודלים שונים, בהם Kontext שמחזיק 2.2 מיליון דוגמאות, תת-מאגר מבוסס Qwen עם 2 מיליון דוגמאות, Step1X-Edit עם 900 אלף, ועוד סטים קטנים יותר ממודלים כמו Bagel, GPT-4o, LaMa, TextFlux ו־OmniConsistency.

המבנה הפנימי מחולק לתיקיות לפי המודל שייצר את הנתונים, כאשר המידע ארוז בקובצי tar שמכילים כ־5,000 סטים כל אחד. בחלק מהמקרים הסינון התבסס על מודלים חיצוניים: למשל, בנתוני step1x-edit יש ציון איכות מבוסס Qwen2.5-72B, ובחלקים אחרים חושבו ציוני דמיון באמצעות DINOv2 ו־CLIP בין התמונה המקורית לתמונה הערוכה.

בתת-המאגר של qwen-image-edit, הדגש הוא על שמירה על עקביות פנים. המערכת שילבה זיהוי פנים עם חישובי דמיון, ובחנה מדדים ספציפיים כמו רמת ביטחון בזיהוי הפנים, מוצא אתני משוער, והוראות עריכה בשפה הסינית.

מתאים ל

  • אימון עריכת תמונות מונחית טקסט

    אימון מודלים לביצוע משימות עריכה שונות לפי פקודות בשפה טבעית על בסיס מיליוני דוגמאות.

  • שמירה על עקביות פנים

    שימוש בתת-המאגר של Qwen עם ציוני דמיון וזיהוי פנים לצורך עריכה שמשמרת את זהות המצולם.

  • החלפה ועריכת טקסט בתמונה

    אימון מודלים על נתוני TextFlux הכוללים קואורדינטות תיבות טקסט לשילוב כיתובים מדויקים.

איפה זה נופל

חלק משמעותי מהוראות העריכה, במיוחד בתת-המאגר של Qwen, כתוב בסינית ולא באנגלית או שפות אחרות, ואין בו ייצוג לעברית. כל התוכן הוא סינתטי לחלוטין ונוצר על ידי מודלים, מה שאומר שהטיות מודלי המקור והזיות חזותיות מובנות בתוך הדאטה.

בנוסף, חלק מהשדות מסתמכים על סיווגים אוטומטיים של תווי פנים ומוצא אתני ברמת ביטחון מסוימת. אם אתם בונים מודל כללי, חובה לסנן מראש את השדות הללו ולבדוק שהארטיפקטים של מודלי היצירה לא יזלגו לתוצר שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון המוגדר הוא apache-2.0, שמתיר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או מסחריים. התנאי העיקרי הוא שמירה על תנאי הייחוס והצהרת הרישיון המקורית.

האם יש במאגר תמיכה בעברית?

לא. ההוראות בדאטהסט מופיעות בעיקר בסינית או באנגלית, כפי שנוצרו על ידי המודלים השונים כמו Qwen3. אין בו טקסטים או פקודות בעברית.

איך הנתונים נאספו ונבנו בפועל?

הנתונים לא נאספו מצילומי משתמשים אלא יוצרו באמצעות מודלים שונים כמו Qwen-Image, Kontext ו־GPT-4o. לאחר היצירה הם סוננו על בסיס מדדי איכות של מודלים נוספים כמו DINOv2, CLIP ומודל השפה Qwen2.5-72B.

באיזה פורמט המידע מגיע?

המאגר בנוי מ־1,398 קבצים המחולקים לתיקיות לפי המודל שיצר את הדאטה. הנתונים ארוזים בקובצי tar שמכילים כ־5,000 דוגמאות כל אחד, לצד קובצי JSON עם המטא-דאטה והציונים.

איך טוענים

הורדת המאגר נעשית ישירות מ־Hugging Face דרך git lfs ופקודת שיבוט רגילה, ללא צורך בבקשת אישור גישה מראש. המאגר מכיל 1,398 קבצים, בעיקר ארכיוני tar מחולקים לפי מקור הדאטה.

בפועל אתם עובדים מול קובצי JSON ספציפיים לכל תת-תקייה. שדות המפתח משתנים: בחלק תמצאו ציוני CLIP ו־DINO, ב־textflux יש קואורדינטות של תיבות טקסט ופונטים, וב־qwen תקבלו שדות של תיאור מקור, הוראת עריכה ונתוני פנים.

from datasets import load_dataset

ds = load_dataset("OPPOer/X2Edit-Dataset")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה של הנתונים, ואינו מחייב אתכם לשחרר את המודלים שתאמנו תחת אותו רישיון. נדרש רק לתת ייחוס מתאים ולצרף עותק של הרישיון וכתב הוויתור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗