GPT
A

AnyEdit

קוד פתוח

Bin1117cc-by-4.02024-12-12

  • art

המאגר מרכז 2.5 מיליון זוגות תמונות שמיועדים לאימון עריכת תמונה לפי הוראה טקסטואלית. הוא מכסה 25 סוגי עריכות שונות, החל משינוי צבע מקומי ועד תזוזות מצלמה והוראות שמבוססות על ידע כללי.

  • 4,014הורדות בחודש
  • 28לייקים

מה זה

כל רשומה במאגר מייצגת פעולת עריכה בודדת. היא מכילה תמונת מקור, תמונה ערוכה, הוראת טקסט לביצוע, תיאורי תמונה לפני ואחרי, סוג העריכה, ולעיתים גם תמונת ייחוס נוספת או ציון האובייקט הספציפי שנערך. לפי הדוגמאות, חלק מתמונות המקור מגיעות ממאגרים מוכרים כמו COCO.

החומר מחולק לחמישה תחומים עיקריים שכוללים עריכה מקומית, עריכה גלובלית של כלל התמונה, שינויי זווית מצלמה, עריכות מורכבות הדורשות הבנה של ידע כללי, ועריכות חזותיות שנעזרות בתמונת רפרנס. סט האימון כולל כ־2.5 מיליון דוגמאות, סט הוולידציה כולל 5,000, וסט המבחן מכיל 1,250 דוגמאות.

מתאים ל

  • אימון מודלי עריכת תמונה

    לימוד מודלים לבצע שינויים ממוקדים בתמונות קיימות על בסיס הנחיות טקסט באנגלית.

  • עריכה מבוססת תמונת רפרנס

    אימון מערכות שמשתמשות בתמונה נוספת כהנחיה חזותית, כמו העברת טקסטורה או חומר.

  • הערכת ביצועי מודלי תמונה

    בדיקת יכולת המודל להתמודד עם שינויי זווית מצלמה והבנת ידע כללי מול סט המבחן הייעודי.

איפה זה נופל

כל הטקסט וההוראות בדאטהסט מופיעים באנגלית בלבד. אם המטרה שלכם היא מודל שמבין הנחיות בעברית, הנתונים האלה לא יספיקו לבד וידרשו תרגום או התאמה.

בנוסף, הכרטיס מציין שפילטר התצוגה בממשק לא עובד כראוי, ומפנה להורדת חלוקות ספציפיות ממאגר נפרד למי שרוצה סוג עריכה בודד. המפרסמים לא פירטו בכרטיס את הציוד, הצעדים והסינונים המדויקים ששימשו להפקת התמונות הערוכות עצמן, כך שקשה לדעת אילו ארטיפקטים או הטיות ויזואליות נכנסו פנימה בתהליך היצירה בלי לקרוא את המאמר המלא.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המדווח הוא CC-BY-4.0, שמאפשר שימוש מסחרי כל עוד נותנים ייחוס הולם ליוצרים. עם זאת, רשומות רבות מבוססות על תמונות ממאגרים חיצוניים כמו COCO. אם אתם בונים מוצר מסחרי, תצטרכו לוודא שזכויות התמונות המקוריות מאפשרות זאת.

האם יש במאגר תמיכה בהוראות בעברית?

לא. שפת המאגר מוגדרת רשמית כאנגלית בלבד, וכל שדות הטקסט של ההוראות ותיאורי התמונות כתובים באנגלית. כדי לאמן מודל שיבין עברית תצטרכו לתרגם את הטקסטים בעצמכם או לשלב דאטהסט מקביל.

כמה המאגר שוקל ואיך הוא בנוי?

האימון מחולק ל־384 קובצי Parquet שכוללים בתוכם כ־2.5 מיליון דוגמאות עריכה עם קובצי התמונות המלאים. מדובר בנפח תעבורה ואחסון גדול מאוד. אם אתם צריכים רק סוג עריכה ספציפי, היוצרים מציעים להוריד חלוקות מסוימות ממאגר נפרד בשם anyedit-split.

איפה נמצא סט המבחן של הדאטהסט?

סט המבחן, שכולל 1,250 דוגמאות, לא נמצא בקובצי ה־Parquet במאגר הרגיל כדי למנוע זחילה של מודלים וזיהום נתונים. היוצרים מספקים קישור ישיר לקובץ zip שיושב ב־Google Drive, ומשם צריך להוריד אותו ידנית.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה של Hugging Face בפקודת load_dataset עם המזהה Bin1117/AnyEdit. אין צורך באישור גישה מקדים או בחשבון מיוחד כדי למשוך את האימון.

המאגר מחולק ל־384 קובצי Parquet שונים שכוללים את התמונות עצמן, כך שהורדה מלאה דורשת רוחב פס רציני ונפח אחסון מקומי משמעותי. השדות המרכזיים שמעניינים אתכם בקוד הם image_file לתמונת הבסיס, edited_file לתוצאה, ו־edit לפקודת הטקסט. שימו לב שסט המבחן לא נמצא במאגר הרגיל כדי למנוע זליגת מידע, ואותו מורידים כקובץ zip מקישור חיצוני ב־Google Drive.

from datasets import load_dataset

ds = load_dataset("Bin1117/AnyEdit")

הרישיון

המאגר מוגדר תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי שאתם מעניקים קרדיט מתאים ליוצרים המקוריים ומציינים אם נעשו שינויים. אין דרישה לשתף את המודל המאומן או יצירות נגזרות באותו הרישיון, אך יש לשים לב שלפחות חלק מתמונות המקור הגיעו ממאגרי צד שלישי כמו COCO, ולכן כדאי לוודא שאין סתירה ברישיונות התמונות המקוריות עצמן לפני שיוצאים למוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗