GPT
F

FakeImageDataset

קוד פתוח

InfImagineapache-2.02023-07-07

המאגר כולל תמונות שנוצרו במודלים גנרטיביים שונים לצד תיוג שמציין אם הן אמיתיות או מזויפות. הוא נבנה כבסיס לאימון והערכה של מודלים לזיהוי תמונות סינתטיות.

  • 6,611הורדות בחודש
  • 28לייקים

מה זה

המאגר מחולק לשני מקורות עיקריים: ImageData שבו יושבים קובצי התמונות הדחוסים, ו־MetaData שמרכז קובצי CSV עם התיוג של כל תמונה כריאליסטית או מזויפת.

חלק האימון, שמכונה Fake2M, מורכב מתמונות שנוצרו במודלי Stable Diffusion v1.5, מודל DeepFloyd IF ו־StyleGAN3. שני הראשונים נשענים על פרומפטים מתוך CC3M בהיקף של מיליון תמונות לכל אחד, ברזולוציות של 256 ו־512 פיקסלים, לצד שמונים ושבעה אלף פלטים מ־StyleGAN3.

סט הוולידציה, MPBench, מגוון יותר ומכיל עשרות אלפי תמונות ממקורות נוספים. הוא משלב פלטים של Midjourney v5, מודל CogView2, גרסת Stable Diffusion v2.1, לצד IF ו־StyleGAN3, כשחלקם מתבססים על טקסטים ממאגר CC15K.

מתאים ל

  • אימון מסווגי תמונות בינה מלאכותית

    אימון רשתות לזיהוי פלטים של מודלי דיפוזיה ישנים ו־GAN ברזולוציות סטנדרטיות.

  • בנצ'מרק ליכולות זיהוי זיופים

    הערכת עמידות של מודלי הגנה מול מגוון ארכיטקטורות באמצעות סט הוולידציה.

  • מחקר על תפיסה חזותית אנושית

    השוואת יכולת הזיהוי של מסווגים אוטומטיים מול שיעורי ההטעיה של בני אדם.

איפה זה נופל

התמונות נוצרו במודלים שהיו נפוצים בתחילת 2023, בעיקר Stable Diffusion 1.5 ו־IF, כך שהאימון לא מכסה ארכיטקטורות מודרניות יותר כמו SDXL, פלאקס או גרסאות מתקדמות של מידג'רני. בנוסף, רוב נתוני האימון הם ברזולוציה נמוכה של 256 עד 512 פיקסלים, מה שפחות רלוונטי לזיהוי זיופים ברזולוציות גבוהות של ימינו. סט האימון אינו כולל ייצוג למודלים כמו CogView2 או Midjourney שמופיעים רק בבדיקה, ואין פירוט לגבי מקור התמונות האמיתיות ששימשו להשוואה מול הפלטים המזויפים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא באופן ישיר. המפרסמים מציינים ששימוש מסחרי דורש אישור רשמי בכתב מטעמם, למרות התיוג של Apache-2.0. לצורכי מחקר אקדמי המאגר פתוח לחלוטין.

איך מחברים את התמונות לתוויות שלהן?

בתיקיית MetaData נמצאים קובצי CSV שמקבילים לתיקיות התמונות ב־ImageData. הקבצים האלה מכילים את שמות הקבצים ואת הסימון אם מדובר בתמונה אמיתית או מזויפת.

האם יש במאגר תמיכה בטקסטים בעברית?

לא. הפרומפטים ששימשו ליצירת התמונות מבוססים על חלוקות מתוך Conceptual Captions באנגלית, ואין במאגר טקסטים או הקשר מקומי בעברית.

אילו מודלים גנרטיביים מיוצגים בנתונים?

באימון יש בעיקר Stable Diffusion v1.5, DeepFloyd IF ו־StyleGAN3. בסט הבדיקה נוספו גם דוגמאות מ־Midjourney v5, CogView2 ו־Stable Diffusion v2.1.

איך טוענים

אין כאן טעינה ישירה בשורת קוד אחת של ספריית datasets. מורידים את המאגר בעזרת git-lfs ישירות מהעמוד של Hugging Face, ואז מחברים את קובצי ה־tar המפוצלים ידנית בפקודת cat ופותחים אותם.

המאגר כולל 248 קבצים, והתמונות מחולקות לפי מודלים ותיקיות אימון ובדיקה. כדי לעבוד איתו צריך לטעון את קובצי ה־CSV מתיקיית MetaData, שמכילים את שמות הקבצים והתוויות שמצביעות אם התמונה נוצרה בידי בינה מלאכותית.

from datasets import load_dataset

ds = load_dataset("InfImagine/FakeImageDataset")

הרישיון

למרות שמצוין רישיון Apache-2.0, המפרסמים מגבילים את השימוש למחקר אקדמי בלבד. שימוש מסחרי מותנה בקבלת אישור רשמי בכתב ותרומה לפרויקט דרך פנייה למייל שלהם, כך שבפועל אי אפשר להשתמש במאגר למוצר מסחרי באופן חופשי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗