GPT
C

cc3m-wds

קוד פתוח

pixparseother2023-12-14

גרסה ארוזה בפורמט WebDataset של Conceptual Captions, המכילה תמונות רשת עם תיאורי Alt-text שעברו סינון. היא מיועדת למי שרוצה לאמן מודלי ראייה ושפה בלי להוריד מיליוני קישורים בעצמו.

  • 20,209הורדות בחודש
  • 58לייקים

מה זה

המאגר כולל זוגות של תמונות ותיאורי טקסט שנאספו ישירות מעמודי אינטרנט. במקום כתיבה ידנית ויקרה, התיאורים מבוססים על תגיות Alt-text שעברו תהליך אוטומטי של סינון, ניקוי והחלפת שמות עצם ספציפיים בקטגוריות כלליות יותר כדי לשמור על ניקיון ושטף.

התוכן מחולק לשני חלקים עיקריים שנארזו בקובצי tar באמצעות הכלי img2dataset. סט האימון מכיל 576 קבצים עם 2,905,954 דוגמאות מתוך כ־3.3 מיליון במקור, שירדו בדצמבר 2021. סט האימות כולל 16 קבצים עם 13,443 דוגמאות, שירדו מחדש בדצמבר 2023 לאחר שההורדה המקורית נפגמה.

במהלך ההורדה התמונות עברו התאמת גודל, כך שאם הצלע הקצרה של תמונה הייתה גדולה מ־512 פיקסלים, היא כווצה בדיוק ל־512 פיקסלים תוך שמירה על יחס הגובה-רוחב המקורי.

מתאים ל

  • אימון מקדים של מודלי שפה-תמונה

    לימוד ייצוגים משותפים של תמונה וטקסט על בסיס מיליוני זוגות נתונים מהרשת.

  • יצירת כתוביות לתמונות

    אימון מודלים לייצור תיאורי Alt-text או כתוביות קצרות באופן אוטומטי.

  • הערכת ביצועי מודלי מולטימודל

    בדיקת איכות ההבנה והחיבור בין טקסט לתמונה על סט האימות הנפרד.

איפה זה נופל

הטקסטים מבוססים על תגיות Alt-text מהרשת, כך שהניסוחים משקפים כתיבה שיווקית, כותרות דפים או תיאורים חלקיים ולא תיאור אנושי מדויק ומלא. בנוסף, חסרות כאן מעל 400 אלף דוגמאות מסט האימון המקורי של גוגל כי קישורים רבים נשברו ברשת לפני ההורדה ב־2021. הכרטיס לא מציין תמיכה בשפות שאינן אנגלית, והרזולוציה המקסימלית מוגבלת ל־512 פיקסלים בצלע הקצרה, מה שלא מתאים למשימות הדורשות פרטים עדינים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון המקורי של גוגל שמצוטט בכרטיס מאפשר שימוש חופשי לכל מטרה ומבקש רק מתן קרדיט. עם זאת, התמונות עצמן הגיעו מרחבי הרשת ולכן מומלץ לבדוק את ההשלכות המשפטיות לגבי זכויות יוצרים של התכנים עצמם לפני שילוב במוצר.

האם הדאטהסט כולל עברית?

הכרטיס מתאר איסוף של תיאורי Alt-text באנגלית שעברו סינון ועיבוד של שפה. אין בתיעוד שום אזכור לתמיכה בעברית או בשפות נוספות.

איך הדאטהסט הזה שונה מ־Conceptual Captions המקורי של גוגל?

גוגל פרסמה במקור רק רשימת קישורים לתמונות עם תיאורים, מה שחייב כל חוקר להוריד את התמונות בעצמו. המאגר הזה מכיל את התמונות שכבר הורדו ונארזו בפורמט WebDataset, אך הוא מכיל פחות דוגמאות בגלל קישורים שנשברו ברשת עד מועד ההורדה.

מה הגודל והאיכות של התמונות במאגר?

בזמן ההורדה בוצע שינוי גודל לכל תמונה שהצלע הקצרה שלה הייתה גדולה מ־512 פיקסלים, כך שהיא כווצה ל־512 פיקסלים בדיוק. המאגר אינו שומר על רזולוציות גבוהות יותר.

איך טוענים

הנתונים מגיעים במבנה של WebDataset בתוך 595 קובצי tar, ואינם דורשים אישור גישה מיוחד. כדי לעבוד איתם ביעילות כדאי להשתמש בספריית webdataset ב־Python שמזרימה את הדוגמאות ברצף ישר מהקבצים הארוזים, או דרך התמיכה של ספריית datasets. שדות הליבה הם התמונה עצמה והטקסט המשויך אליה.

from datasets import load_dataset

ds = load_dataset("pixparse/cc3m-wds")

הרישיון

לפי הכרטיס של גוגל ניתן להשתמש במידע באופן חופשי לכל מטרה, כולל שימוש מסחרי, ללא דרישת שיתוף זהה, אם כי גוגל מבקשת מתן קרדיט. הדאטהסט מוגש כפי שהוא וללא אחריות. יחד עם זאת, התמונות עצמן נאספו מאתרים שונים ברשת וזכויות היוצרים עליהן עשויות להיות שייכות ליוצרים המקוריים.

הרישיון המלא ב־Hugging Face ↗