GPT
N

NHR-Edit

קוד פתוח

iitolstykhapache-2.02025-07-17

  • image-editing
  • generative-ai
  • triplet-mining

מאגר לאימון מודלים של עריכת תמונות לפי הוראות טקסטואליות. הוא מציע שלשות סינתטיות מלאות של תמונת מקור, הוראה ותוצאה, שנוצרו באוטומציה מוחלטת ללא סינון אנושי.

  • 3,586הורדות בחודש
  • 51לייקים

מה זה

המאגר מכיל 358,463 שלשות של עריכה שמבוססות על 286,608 תמונות מקור ייחודיות. כל רשומה כוללת נתיב לתמונת מקור, נתיב לתמונה ערוכה, הוראת עריכה ראשית באנגלית, ורשימה של ניסוחים חלופיים לאותה פעולה. בנוסף יש מטא דאטה מפורט שכולל את קטגוריית הפעולה כמו הוספת עצם או מחיקת רקע, כיוון העריכה, סגנון ויזואלי, רזולוציה מקורית, הפרומפט המלא והסידים ששימשו ליצירה.

כל הנתונים הופקו באופן סינתטי ואוטומטי לחלוטין דרך תהליך שנקרא NoHumanRequired, בלי תיוג אנושי ובלי בדיקת איכות ידנית. חשוב להבין שזהו רק החלק הראשון מתוך שניים. כדי לקבל את הדאטה המלא לאימון, צריך להוריד גם את החלק השני שיושב במאגר נפרד.

מתאים ל

  • אימון מודלי עריכת תמונה

    לימוד מודלים לבצע שינויים ממוקדים בתמונות על בסיס פקודות טקסט חופשיות באנגלית.

  • הרחבת ניסוחי הוראות

    שימוש ברשימת הניסוחים החלופיים כדי לאמן מודלים להתמודד עם פניות מגוונות מאותו סוג.

  • בקרת סגנון וקטגוריות

    אימון מערכות עריכה מונחות סגנון או קטגוריה ספציפית בעזרת המטא דאטה של הפעולות.

איפה זה נופל

החיסרון המרכזי כאן הוא היעדר מוחלט של מגע אדם. כל התמונות וההוראות נוצרו על ידי מודלים, וללא סינון אנושי ייתכנו תקלות ויזואליות, הוראות לא מדויקות וארטיפקטים שזלגו פנימה. בנוסף, הטקסטים והפרומפטים קיימים אך ורק באנגלית, כך שאין שום תמיכה מובנית בעברית או בהקשרים מקומיים. מי שמתכנן להשתמש בזה למוצר פרודקשן יצטרך לבצע סינון איכות מדגמי משלו לפני האימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הנתונים מופצים ברישיון Apache 2.0 שמתיר שימוש מסחרי חופשי. אין מגבלה על מכירת מודלים שאומנו על המאגר, כל עוד מקפידים על דרישות הייחוס ושמירת הודעת הרישיון המקורית.

האם יש בדאטהסט תמיכה בשפה העברית?

לא, כל ההוראות והפרומפטים במאגר נכתבו באנגלית בלבד. כדי להתאים מודל להוראות בעברית, תצטרכו לתרגם את הטקסטים באופן עצמאי או לאמן שכבת התאמה לשונית.

האם המאגר הזה מכיל את כל הנתונים של הפרויקט?

לא, המאגר הזה כולל רק את החלק הראשון מתוך שניים. היוצרים מציינים במפורש שכדי לקבל את מערך האימון המלא יש להוריד גם את החלק השני ולמזג ביניהם.

איך נאספו התמונות וההוראות בפועל?

כל השלשות במאגר נוצרו באופן סינתטי ואוטומטי לחלוטין באמצעות פייפליין ייעודי. התהליך לא כלל בדיקה, אימות או סינון של בני אדם לאורך כל שלבי היצירה.

איך טוענים

הנתונים מחולקים ל־37 קובצי Parquet ששמורים במאגר פתוח לציבור, ללא צורך בהרשמה מיוחדת או אישור גישה. אפשר לטעון אותם בקלות דרך ספריית datasets הרגילה. כשמפצלים את המידע לאימון וולידציה, אסור בשום אופן לבצע דגימה אקראית רגילה לפי שורות, כי תמונת מקור אחת משמשת למספר עריכות שונות. כדי למנוע זליגת מידע שתנפח את הציונים, חובה לקבץ ולפצל את הדאטהסט לפי הערכים בעמודת original_seed.

from datasets import load_dataset

ds = load_dataset("iitolstykh/NHR-Edit")

הרישיון

המאגר משוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים והפצה מחודשת שלהם. מותר לאמן עליו מודלים מסחריים בלי חובה לחשוף את הקוד או את המשקולות, אך נדרש לתת קרדיט ליוצרים המקוריים ולצרף עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗