GPT
X

X2I-subject-driven

קוד פתוח

yzwangapache-2.02024-12-01

מאגר שמיועד לאימון מודלים על עריכת תמונות מונחית עצמים ודמויות. הוא כולל מיליוני דוגמאות שמחברות בין תמונות מקור להנחיות טקסט, נבנה עבור פרויקט OmniGen ומתמקד בשימור זהות של אובייקטים.

  • 8,736הורדות בחודש
  • 15לייקים

מה זה

המאגר מחולק לשלושה חלקים עיקריים שמרכיבים יחד סדר גודל של מיליוני רשומות לעריכת תמונה לפי נושא. החלק הראשון נקרא Web-Image, והוא אוסף שנבנה עצמאית המכיל שלוש קבוצות של 36,316, 45,425 ו־111,734 דוגמאות, יחד עם קובצי מטא-דאטה בפורמט jsonl.

החלק השני מבוסס על GRIT-Entity ומכיל 1,708,742 דוגמאות של ישויות. החלק השלישי הוא GRIT-Entity-New, שמכיל 676,603 דוגמאות. לפי כרטיס המאגר, החלק השלישי אמנם קטן יותר מ־GRIT-Entity הרגיל, אך הוא נבנה עצמאית ומציע איכות דאטה גבוהה יותר.

הנתונים מאורגנים לפי חלוקות של דמויות, בני אדם, ועצמים בודדים, כפולים או משולשים. המטרה של המבנה הזה היא לאפשר למודלים ללמוד כיצד לעבד ולשנות תמונה תוך שמירה על עקביות של הדמות או האובייקט שמופיעים בה.

מתאים ל

  • עריכת תמונות מונחית עצם

    אימון מודלים לשמירה על עקביות של דמות או מוצר ספציפי בזמן יצירת תמונה חדשה מפקודת טקסט.

  • החלפת אובייקטים ודמויות

    שימוש בחלוקות של human ו־character לפיתוח יכולות של שינוי מבוקר של אלמנטים בתוך תמונה קיימת.

  • מחקר על שמירת זהות

    הערכת ביצועים של מודלי תמונה מרובי משימות על סטים בגדלים ובאיכויות שונות מתוך GRIT.

איפה זה נופל

הכרטיס לא מפרט כמעט שום מידע על תהליך הסינון או ההטיות, מעבר לאמירה שחלק אחד הוא באיכות גבוהה יותר מהאחר. השפה המוגדרת היא אנגלית בלבד, כך שאין כאן תמיכה מובנית בעברית או בהנחיות מקומיות.

התוכן נאסף מהרשת ומבוסס על חלקי GRIT, מה שאומר שחובה לבדוק ידנית מדגמים של התמונות והטקסטים לפני שמשלבים אותם באימון סופי. המפרסמים לא תיעדו בעיות בטיחות, תוכן בעייתי או זכויות יוצרים של התמונות המקוריות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0 שמאפשר שימוש מסחרי מלא. צריך לזכור לתת קרדיט למפרסמים ולצרף את עותק הרישיון, אך אין חובה לחשוף את קוד המודל שלכם.

האם יש במאגר תמיכה בעברית?

לא, השפה היחידה שמוגדרת במאגר היא אנגלית. כל קובצי ה־jsonl וההנחיות נכתבו באנגלית, ואם תרצו לעבוד בעברית תצטרכו לתרגם את המטא-דאטה בעצמכם.

כמה מורכב תהליך הטעינה וההורדה של הדאטה?

ההורדה דורשת עבודה ידנית יחסית ולא מסתכמת בקריאה פשוטה בקוד. המאגר מכיל 535 קבצים שחלקם ארכיונים דחוסים ומפוצלים שצריך לאחד ולחלץ במערכת הקבצים המקומית.

מה ההבדל בין GRIT-Entity לבין GRIT-Entity-New?

הגרסה המקורית של GRIT-Entity במאגר כוללת כ־1.7 מיליון דוגמאות. הגרסה החדשה קטנה בהרבה, כ־676 אלף דוגמאות, אך המפתחים מציינים שהיא נבנתה עצמאית ומספקת איכות נתונים גבוהה יותר.

איך טוענים

אין צורך לבקש אישור גישה מיוחד, המאגר פתוח להורדה ישירה דרך Hugging Face. עם זאת, הוא לא מגיע במבנה של שורה אחת ב־datasets של פייתון, אלא מפוצל ל־535 קבצים, כולל ארכיוני tar.gz מפוצלים לחלקים כמו double.tar.gz.aa ודומיו.

כדי לעבוד איתו צריך להוריד את הקבצים, לאחד את החלקים המפוצלים באמצעות פקודות מערכת, ולפתוח את הארכיונים לפי הנתיבים שמצוינים בתיעוד. קובצי המטא-דאטה המרכזיים שמחברים את המידע הם קובצי jsonl כמו web-image ו־grit-entity, והם השדות שדרכם תמפו את התמונות להנחיות.

from datasets import load_dataset

ds = load_dataset("yzwang/X2I-subject-driven")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הנתונים והפצה שלהם, בכפוף למתן קרדיט ושמירה על תנאי הרישיון המקוריים. הוא לא מחייב אתכם לשחרר את המודלים שתאמנו עליו באותו הרישיון, מה שמקל על שילוב שלו בפרויקטים פנימיים או מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗