GPT
S

ScaleEdit-12M

קוד פתוח

InternVL-Ucc-by-nc-sa-4.02026-03-20

  • image-editing
  • instruction-based-editing
  • multimodal
  • computer-vision
  • scaleedit

מאגר ענק של 11.8 מיליון זוגות תמונות והוראות לעריכת תמונה מבוססת טקסט. הוא מתאים למי שמאמן מודלים ומחפש נפח עצום בלי תלות בנתונים שנוצרו במודלים מסחריים סגורים.

  • 7,913הורדות בחודש
  • 23לייקים

מה זה

המאגר מכיל דוגמאות של משימות עריכה מתמונה לתמונה. כל רשומה כוללת מזהה, קטגוריית משימה, הוראת עריכה מילולית באנגלית, את נתוני התמונה הערוכה, ומידות של שתי התמונות. המידע מסודר לפי 23 משפחות של משימות עריכה, כמו העברת סגנון והתאמת גוונים, כאשר כל קטגוריה יושבת בתיקייה נפרדת ומחולקת למספר קבצים.

מקור התמונות מגיע משילוב של תמונות סינתטיות וסריקה מהרשת הפתוחה. חלק מהתמונות המקוריות מהרשת עברו סינון לפרטיות, בטיחות וסימני מים, וכדי להימנע מהפצה ישירה של קבצים מוגנים, המאגר מספק עבורן כתובת מקור, חותמת זמן של ההורדה ובדיקת גיבוב מסוג SHA-256 במקום קובץ בינארי. התמונות הערוכות עצמן נוצרו כולן על ידי סוכנים אוטונומיים במערכת ScaleEditor.

הסינון התבסס על מנגנון בדיקת איכות בשלושה צירים עם ציונים של 1 עד 3: מידת ההיענות להוראה, עקביות מול תמונת המקור, ואיכות ויזואלית כללית. החוקרים שמרו במאגר רק דוגמאות שקיבלו ציון מושלם 3 בהיענות להוראה, ולפחות ציון 2 בשני המדדים האחרים.

מתאים ל

  • אימון מודלי עריכת תמונה

    לימוד משימות עריכה מונחות טקסט, כמו מחיקה והוספה של אובייקטים או שינוי סגנון לפי פקודה.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של נתוני אימון שנוצרו על ידי סוכנים פתוחים מול נתונים שנוצרו ב־APIs מסחריים.

  • הערכת ביצועי שינוי תמונה

    בניית מבחני הערכה ממוקדים ל־23 קטגוריות עריכה שונות כדי למדוד עקביות ויזואלית.

איפה זה נופל

ההוראות והטקסט במאגר כתובים כולם באנגלית, ואין כאן נתונים בעברית בכלל. בנוסף, העובדה שחלק מתמונות המקור מוגשות כקישורים חיצוניים ולא כקבצים אומרת שקישורים יישברו עם הזמן ואי אפשר להבטיח שחזור מלא של כל הרשומות בעתיד. מעבר לזה, תהליך הייצור והסינון כולו נשען על מודלים וסוכנים אוטונומיים, כך שציוני האיכות עלולים לכלול עיוורון להטיות מובנות של אותם סוכנים, וחשוב לדגום ולבדוק בעין את התוצאות לפני אימון מלא.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC-SA 4.0 והוא אוסר במפורש שימוש מסחרי. המאגר מתאים למחקר אקדמי, ניסויים פנימיים ופיתוח מודלים פתוחים שאינם למטרות רווח.

כמה מקום בדיסק צריך כדי להוריד את הכל?

המאגר כולל 253 קבצים, כשחלק גדול מקבצי ה־Parquet מגיע לגודל של כ־31 גיגהבייט לקובץ בודד. תצטרכו נפח אחסון פנוי של כמה טרה-בייט כדי להחזיק את כל הנתונים מקומית.

למה בחלק מהשורות אין קובץ תמונה מקורית?

תמונות שנאספו בסריקת רשת לא מאוחסנות ישירות כקבצים כדי לכבד פרטיות ובטיחות. עבור הדוגמאות האלה תקבלו קישור להורדה ישירה מקורית וקוד גיבוב לאימות הקובץ.

האם יש במאגר תמיכה בשפה העברית?

לא. כל הוראות העריכה והטקסטים במאגר נכתבו באנגלית בלבד. אם המטרה היא עריכה לפי הוראות בעברית, תצטרכו לתרגם את הטקסטים או לאמן שכבת תרגום בנפרד.

איך טוענים

הנתונים מחולקים ל־253 קבצי Parquet שמפוזרים בתיקיות לפי משימות. כל קובץ שוקל בערך 31 גיגהבייט, כך שהנפח הכולל מגיע למספר טרה-בייט ודורש תשתית אחסון ותקשורת רצינית מאוד. אין צורך באישור גישה מיוחד כדי להוריד. כשכותבים קוד טעינה, צריך לקחת בחשבון שעמודת התמונה המקורית מחזירה ערך ריק עבור חלק מהדוגמאות, ובמקרים האלה חייבים לכתוב סקריפט נפרד שמוריד את התמונה מהקישור בעמודת הכתובת ובודק את הגיבוב שלה.

from datasets import load_dataset

ds = load_dataset("InternVL-U/ScaleEdit-12M")

הרישיון

המאגר מופץ תחת רישיון CC BY-NC-SA 4.0. זה אומר שאסור להשתמש בו לצרכים מסחריים מכל סוג שהוא, חובה לתת ייחוס ליוצרים, וכל עבודה נגזרת חייבת להתפרסם תחת אותו רישיון בדיוק. אם תאמנו מודל על הדאטהסט הזה, הרישיון לא יאפשר לכם למכור אותו או לשלב אותו במוצר שמייצר הכנסות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗