GPT
I

instructpix2pix-clip-filtered

קוד פתוח

timbrooksרישיון לא דווח2023-02-24

המאגר מרכז זוגות תמונות עם הוראות טקסט לעריכה ומיועד לאימון מודלים של עריכת תמונה מונחית שפה. הסינון בוצע באמצעות מודל כדי להבטיח התאמה מדויקת בין הפעולה המבוקשת לתוצאה.

  • 6,396הורדות בחודש
  • 48לייקים

מה זה

המאגר כולל בין 100 אלף למיליון רשומות שמיועדות לאימון מודלים שמבצעים עריכת תמונות לפי פקודות טקסט. כל דגימה בנויה מתמונת מקור בשדה original_image, הוראת עריכה מילולית בשדה edit_prompt, ותוצאת העריכה הסופית בשדה edited_image שמציגה את השינוי הוויזואלי בפועל לאחר החלת הפקודה על המקור.

הנתונים נשמרים בפורמט פארקט ומחולקים לאימון על פני מאות קבצים נפרדים. כרטיס המאגר מציין שהוא עבר סינון באמצעות מודל התאמה בין תמונה לטקסט כדי לנקות דוגמאות שאינן תואמות, אך מעבר לכך לא מפורט בכרטיס מהו מקור התמונות המקורי, מי יצר את ההוראות או אילו שלבי עיבוד נוספים בוצעו בהם.

מתאים ל

  • אימון מודל לעריכת תמונה

    לימוד מודלים לבצע שינויים ויזואליים מדויקים על בסיס הנחיות טקסט באנגלית.

  • הערכת ביצועי מודלי עריכה

    בדיקת יכולת המודל ליישם פקודות עריכה בהשוואה לזוגות תמונות מסוננים.

  • מחקר בהתאמת שפה ותמונה

    ניתוח האופן שבו פקודות טקסט משפיעות על שכבות העיבוד הוויזואלי במודל.

איפה זה נופל

הטקסטים במאגר קיימים אך ורק באנגלית, כך שאין שום תמיכה מובנית בעברית או בניואנסים לשוניים מקומיים. כרטיס הנתונים מודה במפורש בחוסר מידע לגבי הטיות, אופן האיסוף, מידע רגיש ומגבלות ספציפיות, מה שדורש בדיקה ידנית מעמיקה של איכות התמונות וההנחיות לפני שמשלבים את המודל בסביבה מעשית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון הוגדר כרישיון מותאם אישית אך פרטיו לא מפורטים ישירות בעמוד. ללא בדיקה של תנאי הרישיון המקוריים, לא ניתן לדעת אם שימוש מסחרי מותר. במצב הנוכחי כדאי להניח שהוא מיועד למחקר בלבד עד להודעה חדשה.

האם יש במאגר הוראות עריכה בעברית?

לא, כל הוראות העריכה במאגר הן באנגלית בלבד. אם רוצים לאמן מודל שיבין עברית, תצטרכו לתרגם את השדות או לאסוף דאטה ייעודי. אימון ישיר על המאגר הזה יאפשר למודל להגיב רק לפקודות באנגלית.

איך בנויים הקבצים וכמה מידע יש כאן?

המאגר מורכב מ־263 קבצי פארקט שמכילים סך הכל בין מאה אלף למיליון רשומות. כל רשומה מחזיקה שתי תמונות ומשפט עריכה. מדובר בנפח אחסון גדול שמחייב חיבור מהיר ומקום בדיסק לפני שמתחילים למשוך את הקבצים.

מאיפה הגיעו התמונות ואיך הן סוננו?

התמונות עברו סינון באמצעות מודל כדי להבטיח שהפקודה מתאימה לתוצאת העריכה. עם זאת, הכרטיס אינו מפרט מאיזה מקור נלקחו התמונות המקוריות או כיצד נוצרו ההוראות. מפתחי המאגר הפנו למאמר ולריפו לקבלת פרטים מעבר למה שנכתב.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטס ללא צורך באישור גישה מיוחד. המאגר מפוצל ל־263 קבצי פארקט שונים, לכן כדאי להגדיר מראש אחסון מהיר ונפח דיסק מתאים להורדה של עשרות עד מאות אלפי רשומות שמכילות מידע ויזואלי כבד. השדות הקריטיים לתהליך העבודה הם הוראת העריכה ותמונות המקור והיעד.

from datasets import load_dataset

ds = load_dataset("timbrooks/instructpix2pix-clip-filtered")

הרישיון

הרישיון מוגדר כמותאם אישית והפרטים המלאים שלו לא דווחו במפורש בטקסט של הכרטיס, שמפנה לקובץ חיצוני. במצב כזה לא ברור אם השימוש המסחרי מותר, מהן דרישות הייחוס, והאם חלות הגבלות על מודלים שמאומנים על המאגר. עבור מוצר מסחרי, מומלץ לא לגעת בנתונים עד לבירור משפטי של תנאי הרישיון המדויקים.

הרישיון המלא ב־Hugging Face ↗