GPT
Y

YFCC100M_OpenAI_subset

קוד פתוח

dalle-miniרישיון לא דווח2022-03-02

אוסף של כמעט חמישה עשר מיליון תמונות עם תיאורים ומידע נלווה מתוך פליקר. הוא משחזר את תת הקבוצה ששימשה לאימון קליפ, כך שאפשר לחקור עליה או לאמן מודלי ראייה וטקסט בלי לגרד הכל לבד.

  • 9,243הורדות בחודש
  • 28לייקים

מה זה

המאגר מכיל תמונות אמיתיות שנלקחו מתוך המאגר המקורי של יאהו, בהתבסס על הסינון שהגדירה OpenAI עבור קליפ. הצוות של dalle-mini אסף והוריד רק את התמונות שהיו עדיין זמינות ברשת בעת האיסוף. כל רשומה כוללת את קובץ התמונה הגולמי עצמו, מזהי משתמשים, מיקומי צילום, תגיות, תאריכי העלאה, ופרטי המצלמה שבה השתמשו המשתמשים המקוריים בפליקר.

בנוסף לטקסט המקורי, הרשומות כוללות גרסאות נקיות של הכותרת והתיאור. הניקוי שמבוצע בקוד מסיר תגיות HTML, מפענח כתובות רשת ומנקה רווחים כפולים וירידות שורה מיותרות. החלוקה הפנימית מפרידה את המידע לשני חלקים ברורים, כאשר חלק האימון כולל 14,808,859 דוגמאות וחלק האימות מכיל 16,374 דוגמאות בלבד.

מתאים ל

  • אימון מודלי מולטימודל

    אימון וחידוד מודלים שמקשרים בין תמונה לטקסט טבעי בקנה מידה גדול.

  • שחזור תוצאות של קליפ

    בדיקת ביצועים וניסויי שחזור של ארכיטקטורות המבוססות על נתוני OpenAI.

  • מחקר על תיוג ומטא דאטה

    ניתוח הקשר בין תגיות גולמיות, מיקום גאוגרפי והתמונות עצמן.

איפה זה נופל

הנתונים נשענים על מה שהיה זמין להורדה מחדש, כך שלא כל התמונות ש־OpenAI השתמשה בהן במקור נמצאות כאן. הטקסטים משקפים תיאורים חופשיים של אנשים שהעלו תמונות לפליקר, כולל תגיות אישיות וללא פיקוח אחיד על איכות התוכן. אין פירוט בכרטיס על השפות שנכללו או על סינון של תוכן פוגעני, כך שאי אפשר להסתמך עליו בעיניים עצומות למוצר סופי.

שאלות
נפוצות

האם מותר להשתמש במאגר לשימוש מסחרי?

הרישיון הכללי של המאגר לא דווח. כל תמונה כוללת בנתונים שלה קישור לרישיון המקורי שלה מפליקר, ולכן אי אפשר להניח שמותר להשתמש בה מסחרית בלי לסנן לפי הרישיון הנקודתי של כל קובץ.

כמה מקום בדיסק צריך כדי לעבוד איתו?

חלק האימון דורש 1.9 טרה בייט וחלק האימות שוקל עוד 2.1 ג'יגה בייט. מעבר לקבצים המכווצים, יש לקחת בחשבון את המקום שיידרש לפריסה ולשמירת קובצי המטמון.

האם יש במאגר תיאורים בעברית?

הכרטיס לא מפרט אילו שפות נכללות בתיאורים או בכותרות. המידע מבוסס על תת הקבוצה של OpenAI מתוך פליקר העולמית, כך שרובו באנגלית, אך ייתכנו תיאורים בשפות נוספות.

במה הוא שונה מ־YFCC100M המקורי?

המאגר המקורי הכיל מאה מיליון פריטים. כאן מדובר רק בסינון שהגדירה OpenAI עבור קליפ, וגם מתוכו נשמרו רק התמונות שהיו זמינות בפועל להורדה ברשת.

איך טוענים

טעינת הנתונים דורשת מקום אחסון משמעותי, שכן חלק האימון שוקל 1.9 טרה בייט וחלק האימות שוקל עוד 2.1 ג'יגה בייט. המאגר מפוצל לאלפי קובצי ארכיון מכווצים שנטענים באמצעות סקריפט פייתון ייעודי. התמונות שמורות כבתים בינאריים בשדה ייעודי, וטוענים אותן ישירות לזיכרון כקובצי תמונה רגילים. הטקסטים הנקיים מוכנים לעבודה, אך מי שרוצה את המטא דאטה המלא ימצא שם גם תגיות ידניות וממוחשבות.

from datasets import load_dataset

ds = load_dataset("dalle-mini/YFCC100M_OpenAI_subset")

הרישיון

הרישיון של המאגר הזה לא דווח בכרטיס. מאחר שמדובר בתמונות פליקר שנאספו על פני שנים, כל רשומה מחזיקה שדות עם שם הרישיון המקורי שלה וכתובת האינטרנט שלו. כל עוד אין רישיון גורף וברור למאגר כולו, אימון של מודל מסחרי או הפצה מחדש של הנתונים מסוכנים משפטית ומחייבים בדיקה פרטנית של הרישיון בכל תמונה.

הרישיון המלא ב־Hugging Face ↗