GPT
M

megalith-10m

קוד פתוח

madebyollinmit2024-06-30

עשרה מיליון קישורים לתמונות פליקר בנחלת הכלל או ברישיונות פתוחים. הבחירה המתאימה לאימון מודלים חזותיים למי שרוצה להימנע מראש מסיבוכי זכויות יוצרים.

  • 858הורדות בחודש
  • 107לייקים

מה זה

המאגר מכיל כעשרה מיליון קישורים ישירים לתמונות אמיתיות מפליקר, ולא את קובצי התמונה עצמם. החומר הגולמי נאסף דרך ה־API של פליקר מתוך כ־12 מיליון תמונות שהוגדרו מראש תחת רישיונות חופשיים, כמו CC0, יצירות ממשל פדרלי אמריקאי, נחלת הכלל או ללא הגבלות זכויות יוצרים ידועות.

היוצר סינן החוצה כ־2 מיליון קישורים כדי להשאיר רק צילומים נקיים, אותנטיים ולא ערוכים. הסינון כלל בדיקה ידנית של 5,000 החשבונות הפעילים ביותר, זיהוי סימני מים חוזרים, סריקת תגיות EXIF והתיאורים לחיפוש הגבלות זכויות יוצרים, בדיקת כפילויות, סף רזולוציה מינימלי של 256 על 256 פיקסלים, ושימוש ב־CLIP כדי להעיף איורים, רנדרים תלת מימדיים, צילומי מסך ותכנים אלימים או מיניים.

מתאים ל

  • אימון מודלי יצירת תמונה

    בסיס נתונים רחב וחופשי מזכויות יוצרים לאימון מודלי דיפוזיה או מודלים אוטורגרסיביים.

  • אימון מודלים רב-מודאליים

    שילוב עם מאגרי כיתובים קהילתיים קיימים לפיתוח מודלי ראייה ושפה (VLM) כמו DeepSeek-VL2.

  • זיהוי תמונות סינתטיות

    שימוש בתמונות צילום טבעיות כקבוצת ביקורת באימון גלאים לזיהוי תמונות שנוצרו ב־AI.

איפה זה נופל

למרות הסינון, המאגר רחוק מלהיות מושלם. על פי בדיקה מדגמית של היוצר, בין חמישה לשבעה אחוזים מהתמונות כוללות עריכות קלות כמו חותמות זמן ועיבודי צבע, ועד שני אחוזים עשויות להכיל סימני מים שמטילים ספק במעמד הזכויות שלהן. בנוסף, אחוז עד שניים מהתמונות כוללים בכל זאת איורים, ציורים או נשק ופוזות פרובוקטיביות. מבחינת ייצוג העולם, מדובר בצילומים מפליקר עם הטיה מערבית כבדה וללא ייצוג מכוון לישראל או לעברית, כך שלא כדאי לבנות עליו לבדו עבור מודל שנדרש להבין הקשרים מקומיים או תרבויות ספציפיות.

שאלות
נפוצות

האם המאגר כולל את קובצי התמונות בפועל?

לא, המאגר מכיל רק קישורים לתמונות בפליקר ומטא-דאטה בעשרה קובצי Parquet. כדי לעבוד עם הפיקסלים תצטרכו להריץ סקריפט הורדה כמו img2dataset או למשוך עותק שמור שהקהילה ארגנה.

האם יש במאגר כיתובי טקסט לתמונות?

במאגר המקורי אין תיאורי טקסט מובנים לאימון. ארגונים בקהילה כמו DrawThings, AI Picasso ו־CaptionEmporium שחררו מאגרי כיתובים נפרדים שתואמים לתמונות הללו על בסיס מודלי ראייה שונים.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

טבלת הקישורים מופצת ברישיון MIT שמתיר שימוש מסחרי מלא, והתמונות סוננו לפי הגדרות נחלת הכלל ו־CC0 בפליקר. עם זאת, בדיקה מדגמית הראתה שעד כשני אחוזים מהתמונות עלולות להכיל זכויות יוצרים שגויות, ולכן נדרשת זהירות ובדיקה פנימית.

האם יש במאגר תכנים בעברית או ייצוג מקומי?

אין במאגר התייחסות מיוחדת לעברית או לישראל, ומאחר שהמקור הוא פליקר, התוכן נוטה לשקף בעיקר מדינות מערביות ומשתמשים דוברי אנגלית. מי שצריך זיהוי של אתרים ישראליים או טקסט מקומי יצטרך להוסיף דאטה ייעודי.

איך טוענים

הנתונים מחולקים לעשרה קובצי Parquet סטנדרטיים בתיקיית data, לצד מחברת הדגמה בפורמט Jupyter שמציגה דגימה של מאה תמונות. הגישה חופשית לגמרי ואינה דורשת אישור מיוחד. בפועל אתם מורידים טבלת קישורים ומטא-דאטה, כך שכדי להשתמש בתמונות עצמן תצטרכו להוריד אותן בעצמכם בעזרת כלים כמו img2dataset, או להשתמש בארכיון התמונות המוכן שחברת DrawThings העלתה ל־Hugging Face. שימו לב שהמאגר המקורי אינו כולל תיאורי טקסט לתמונות, אך קיימים מאגרים חיצוניים בקהילה שהוסיפו כיתובים שנוצרו במודלים שונים.

from datasets import load_dataset

ds = load_dataset("madebyollin/megalith-10m")

הרישיון

המאגר עצמו מופץ תחת רישיון MIT, שמאפשר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה, ללא חובת שיתוף באותו רישיון. עם זאת, התמונות עצמן יושבות בפליקר תחת רישיונות נחלת הכלל שונים, ולכן היוצר ממליץ במפורש לבצע בדיקה עצמאית של הסטטוס המשפטי והתוכן של התמונות לפני שמכניסים מודל שאומן עליהן למוצר מסחרי אמיתי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗