GPT
O

OpenFake

קוד פתוח

ComplexDataLabcc-by-nc-4.02025-05-15

  • deepfake
  • synthetic
  • fake

מאגר לאימון והערכה של זיהוי תמונות שנוצרו בבינה מלאכותית, עם דגש על פוליטיקה ופייק ניוז. הוא משלב מודלים מסחריים סגורים לצד קוד פתוח ותמונות אמיתיות ממקורות מגוונים.

  • 30,281הורדות בחודש
  • 32לייקים

מה זה

המאגר מציע תמונות ברזולוציה גבוהה ומחלק אותן לתמונות אמיתיות מול סינתטיות. התמונות האמיתיות מגיעות מסינון מבוסס מודל ראייה מתוך מאגר לאיון, לצד תמונות מפלטפורמת פקסלס, דוקי, אימג'נט ורדיט. התוכן מתמקד בנושאים טעונים פוליטית וחברתית, כמו דמויות ציבוריות, הפגנות, אסונות וממים שמכילים טקסט.

הצד הסינתטי מכסה כשמונים מחוללים שונים, החל מכלים מסחריים מתקדמים כמו מודלים של גוגל, אופן איי איי ומידג'רני, דרך מודלי קוד פתוח כמו פלאקס וסטייבל דיפיוז'ן, ועד פיין טיונים ופריימים מחוללי וידאו. כל רשומה כוללת את התמונה עצמה, תיוג, שם המודל, סוג המחולל, תאריך השחרור והפרומפט ששימש ליצירתה.

המבנה מחולק לשתי תצורות עבודה. התצורה המרכזית כוללת סטים של אימון, ולידציה ובדיקה, כאשר הבדיקה מכילה מודלים ומקורות תמונה שלא הופיעו באימון כדי לבדוק הכללה. התצורה השנייה מכילה סט בדיקה שנאסף כולו מרדיט כדי לדמות תוכן אמיתי ברשת שסובל מדחיסה ומקור לא ודאי.

מתאים ל

  • אימון מסווגי זיוף תמונות

    בניית מודלים שמבדילים בין תמונות מצולמות אמיתיות לתוצרי בינה מלאכותית על בסיס תוכן חדשותי.

  • מדידת הכללה למודלים חדשים

    בדיקת ביצועים של מסווג קיים מול מחוללים שלא נחשף אליהם כלל באימון דרך סט הבדיקה הייעודי.

  • בדיקת עמידות לדחיסת רשת

    הערכת שרידות של מודלי זיהוי על תמונות שעברו עיבוד ודחיסה ברשתות חברתיות באמצעות נתוני רדיט.

איפה זה נופל

יש בעיה מתועדת של אי התאמה בין הפרומפט לתמונה בכמעט עשרים אחוז מהתמונות הסינתטיות, בגלל שחזור שגוי בחמישה מחוללים. התיוג לא משפיע על סיווג הזיוף עצמו, אך מצריך הצלבה עם קובץ תיקון חיצוני למי שחוקר טקסט.

בנוסף, קיים חוסר איזון גיאוגרפי שנוטה לפוליטיקה מערבית בגלל מקורות הדאטה. סט הבדיקה של רדיט מסתמך על תיוג לפי שם הפורום שממנו נלקחה התמונה, מה שיוצר רעש מובנה של אחוזים בודדים בתיוגים. הטקסטים והפרומפטים זמינים באנגלית בלבד, כך שאין כאן כיסוי לשפות אחרות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון המוצהר כולל הגבלת שימוש לא מסחרי. בנוסף לכך, חלק מהתמונות הסינתטיות נוצרו במחוללים קנייניים שתנאי השירות שלהם אוסרים תחרות מסחרית, ולכן המאגר מיועד למחקר בלבד.

האם יש במאגר תמיכה בעברית או ייצוג מקומי?

המאגר מבוסס על אנגלית בלבד בפרומפטים ובתיאורי התמונות. התכנים מתמקדים באירועים פוליטיים בעולם המערבי, כך שאין בו ייצוג ייעודי לזירה הישראלית או לטקסטים בעברית.

איך נאספו התמונות האמיתיות במאגר?

התמונות האמיתיות עברו סינון דרך מודל ראייה מתוך מאגר רשת גדול כדי לאתר אירועים חדשותיים ופנים. לצד זאת שולבו תמונות איכותיות ממאגר פקסלס, תמונות מתועדות מאימג'נט ודוקי, וצילומים שנאספו מפורומים ייעודיים ברדיט.

מה ההבדל בין מאגר זה למאגרי זיהוי זיופים אחרים?

מרבית המאגרים בתחום מבוססים על תמונות עצמים כלליות ומספר מצומצם של מודלים פתוחים. כאן הדגש הוא על תוכן פוליטי מורכב, עשרות מחוללים כולל כלים מסחריים סגורים, וסט בדיקה נפרד שבוחן עמידות למחוללים לא מוכרים.

איך טוענים

טוענים את המידע דרך ספריית הדאטהסטס הרגילה בפייתון בעזרת המזהה הרשמי, עם אפשרות לבחור בין התצורה המרכזית לתצורת רדיט. הגישה חופשית ואין צורך באישור ידני מקדים.

הנתונים שמורים כקבצי פרקט שכוללים שדות כמו תמונה מקודדת, תווית אמת או זיוף, שם מודל ופרומפט. כדאי לשים לב שיש קובץ תיקון נפרד בפורמט פרקט לפרומפטים של חמישה מחוללים ספציפיים, שדורש מיזוג לפי מזהה התמונה.

from datasets import load_dataset

ds = load_dataset("ComplexDataLab/OpenFake")

הרישיון

המאגר מוגדר תחת רישיון שאינו מסחרי ודורש ייחוס ושיתוף זהה. השימוש בו מוגבל למחקר ולהערכה בלבד, ולא ניתן להשתמש בו במוצרים מסחריים. תת קבוצות שנוצרו עם מחוללים מסחריים כפופות לתנאי השימוש של אותן חברות, והיוצרים אוסרים במפורש על אימון מודלים גנרטיביים מתוך התמונות האמיתיות או שימוש לצורכי זיהוי פנים ביומטרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗