GPT
C

cc12m-wds

קוד פתוח

pixparseother2023-12-12

חבילה של כמעט 11 מיליון צמדי תמונות וטקסט מהרשת, מוכנה להזרמה מהירה. פתרון מתאים למי שבונה מודלי ראייה ושפה ורוצה נתונים בקנה מידה רחב בלי להוריד ולחלץ קישורים בעצמו.

  • 35,831הורדות בחודש
  • 44לייקים

מה זה

המאגר כולל זוגות של תמונות וכיתובים שנאספו במקור על ידי חוקרי גוגל כגרסה מורחבת של פרויקט Conceptual Captions, במטרה לכסות מושגים ויזואליים נדירים. תהליך הסינון המקורי היה פחות מחמיר מזה של מאגר ה־3M כדי להגיע למסה גדולה יותר של דוגמאות.

מי שהעלה את הגרסה הזו השתמש בכלי img2dataset כדי להוריד את התמונות בפועל ולשמור אותן ישירות בפורמט ארכיונים. התמונות עברו שינוי גודל כך שהצלע הקצרה שלהן לא עולה על 512 פיקסלים. סך הכל הצליחו לחלץ 10,968,539 דוגמאות מתוך ה־12 מיליון המקוריים, והן מחולקות לאימון בלבד בתוך 2,176 קובצי ארכיון.

מתאים ל

  • אימון מקדים של מודלי ראייה

    לימוד ייצוגים ראשוניים למודלים שמשלבים טקסט ותמונה על גבי מיליוני דוגמאות מגוונות.

  • אימון מודלים לכיתוב תמונה

    הזנת דוגמאות רבות לרשת כדי ללמד אותה לייצר תיאור טקסטואלי לתמונות כלליות.

  • חיפוש תמונה לפי טקסט

    בניית מרחב הטמעה משותף שמאפשר לשלוף תמונות מתאימות מתוך שאילתות טקסט חופשיות.

איפה זה נופל

מתוך 12 מיליון קישורים מקוריים נותרו בפועל פחות מ־11 מיליון, כי חלק מהתמונות ברשת כבר נמחקו בעת ההורדה. הסינון במקור היה פחות קפדני בהשוואה למאגרים קטנים יותר, מה שאומר שהכיתובים מכילים יותר רעש, חוסר דיוקים וטקסט שלא תמיד מתאר את התמונה בצורה מלאה. אין כאן נתונים על שפות מעבר לאנגלית, וכל התמונות הוקטנו לרזולוציה בסיסית, כך שזה לא מתאים לעבודה שדורשת פרטים קטנים או חדות גבוהה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הטקסט של גוגל מתיר שימוש חופשי לכל מטרה ומבקש אזכור של החברה כמקור המידע. עם זאת, בעמוד סומן רישיון other, ולכן כדאי לבדוק את קובץ ה־LICENSE במאגר לפני שמשלבים אותו במערכת מסחרית.

כמה דוגמאות יש בפועל במאגר הזה?

המאגר כולל 10,968,539 דוגמאות של תמונה וטקסט, המחולקות בין 2,176 קובצי tar. המספר נמוך מ־12 מיליון המקוריים מכיוון שחלק מהתמונות לא היו זמינות ברשת בזמן ההורדה.

האם הטקסטים כוללים עברית?

לא, הנתונים נאספו מכיתובים ברשת שמבוססים על אנגלית. אין תמיכה מתועדת בשפות אחרות או בעברית במאגר זה.

מה ההבדל בין המאגר הזה לגרסת המקור של גוגל?

גוגל פרסמה רשימת קישורים בלבד שדורשת הורדה עצמאית מהרשת. מי שהעלה את המאגר הזה כבר הוריד את התמונות בפועל, הקטין אותן לצלע של 512 פיקסלים וארז אותן לקובצי WebDataset מוכנים לשימוש.

איך טוענים

הנתונים מחולקים ל־2,176 קובצי tar בפורמט WebDataset, מה שאומר שלא פותחים את כולם לדיסק אלא מזרימים ישירות בטעינה עם ספריית webdataset. המאגר פתוח להורדה ישירה בלי טופסי הרשאה. שמות הקבצים עוקבים, מקובץ train-0000 ועד הסוף, ובכל רשומה מקבלים את קובץ התמונה והטקסט התואם לה.

from datasets import load_dataset

ds = load_dataset("pixparse/cc12m-wds")

הרישיון

לפי כרטיס המקור של גוגל מותר להשתמש במידע לכל מטרה, כולל שימוש מסחרי, ומבקשים לתת קרדיט לגוגל כמקור הנתונים. המאגר מסופק כפי שהוא וללא שום אחריות, אך ברישום של המאגר הנוכחי סומן רישיון other. מומלץ לקרוא את קובץ הרישיון המצורף כדי לוודא שאין תנאים נוספים שהתווספו על ידי מי שארז את הקבצים.

הרישיון המלא ב־Hugging Face ↗