GPT
C

conceptual_captions

קוד פתוח

google-research-datasetsother2022-04-14

מעל שלושה מיליון תיאורי תמונות באנגלית שנאספו אוטומטית מטקסט חלופי ברשת. מתאים למי שרוצה לאמן מודלים של ראייה ושפה על שפה מגוונת יותר מאשר מאגרים מבוססי תיוג אנושי.

  • 12,145הורדות בחודש
  • 111לייקים

מה זה

המאגר מכיל תיאורי תמונות שחולצו מתגיות Alt-text בעמודי אינטרנט ועברו עיבוד אוטומטי מקיף. גוגל סיננו מיליארדי דפים לפי גודל תמונה, תוכן למבוגרים, סנטימנט קיצוני והתאמה בין מילים לתמונה באמצעות Cloud Vision API. שמות פרטיים, מקומות ומותגים הוחלפו במושגים כלליים, כך ששם של שחקנית הופך למושג שחקן, ומיקומים ספציפיים הוסרו כדי שהמודל ילמד לתאר רק את מה שרואים בפיקסלים.

יש שני חלקים עיקריים בקובצי Parquet. החלק הלא מתויג כולל פיצול אימון של 3,318,333 זוגות ופיצול ולידציה של 15,840 זוגות עם כתובת תמונה ותיאור טקסט בלבד. החלק המתויג מכיל תת קבוצה של 2,007,090 רשומות מתוך האימון, הכוללות גם תוויות שחולצו על ידי מכונה, מזהי Knowledge Graph וציוני ביטחון.

מתאים ל

  • אימון מחוללי תיאורי תמונה

    לימוד מודלים לייצר משפטי תיאור באנגלית מתוך תמונות ברמת הכללה רחבה.

  • קדם אימון למודלי ראייה ושפה

    חיבור וקטורי בין ייצוגי תמונה לטקסט על פני מיליוני דוגמאות מגוונות מהרשת.

  • סיווג תמונות מרובה תוויות

    שימוש בתת הקבוצה המתויגת להערכת מודלים מול תוויות וציוני ביטחון של גוגל.

איפה זה נופל

הבעיה המרכזית היא תלות בקישורים חיצוניים. תמונות רבות ברשת נמחקות עם הזמן, כך שבפועל לא תצליחו להוריד את כל שלושת המיליונים. כל התיאורים הם באנגלית בלבד. הסינון האוטומטי מחק מושגים נדירים שהופיעו פחות ממאה פעמים, והחלפת שמות פרטיים במושגים כלליים יוצרת טקסט מעט מלאכותי. בנוסף, הכרטיס מציין שחסר מידע על הטיות חברתיות ופרטיות.

שאלות
נפוצות

האם התמונות עצמן שמורות בתוך הדאטהסט?

לא. הקבצים מכילים רק כתובות אינטרנט של התמונות לצד התיאורים. צריך להוריד את התמונות באופן עצמאי, וחלק מהקישורים כבר לא עובדים בגלל שינויים באתרים המקוריים.

האם יש במאגר נתונים בעברית?

לא. כל התיאורים במאגר נאספו ונשמרו בשפה האנגלית בלבד. אם המטרה היא מודל בעברית, תצטרכו לתרגם את הטקסט או לאמן על מקור אחר.

האם מותר להשתמש בו לפיתוח מודל מסחרי?

כן. תנאי השימוש שגוגל פרסמו מאפשרים שימוש חופשי לכל מטרה, עם בקשה למתן קרדיט. עם זאת, גוגל מסירה אחריות לגבי זכויות היוצרים של התמונות שנאספו ברשת.

במה הוא שונה ממאגרים כמו COCO?

בניגוד לתיאורים שנכתבו ידנית על ידי אנשים באוסף תמונות מוגדר, כאן המקור הוא טקסט חלופי מאתרים אמיתיים. הטקסטים עברו ניקוי אוטומטי שהחליף שמות של אנשים ומקומות בקטגוריות כלליות.

איך טוענים

טוענים את הנתונים ישירות מקובצי Parquet ללא צורך בבקשת גישה מיוחדת. המאגר עצמו לא מכיל את קובצי התמונות אלא כתובות אינטרנט ישירות להורדה, מה שאומר שתצטרכו להריץ סקריפט הורדה עצמאי כדי למשוך את הפיקסלים בפועל. השדות הקריטיים הם כתובת התמונה והתיאור, ובחלק המתויג תמצאו גם תוויות זיהוי וציוני התאמה.

from datasets import load_dataset

ds = load_dataset("google-research-datasets/conceptual_captions")

הרישיון

לפי תנאי השימוש שהוגדרו על ידי גוגל, מותר להשתמש במאגר באופן חופשי לכל מטרה, כולל שימוש מסחרי ומחקר, ללא דרישת שיתוף באותו רישיון. החברה מבקשת מתן קרדיט כמקור הנתונים, אך המאגר מסופק ללא אחריות לתוכן או לזכויות היוצרים של התמונות המקוריות ברשת.

הרישיון המלא ב־Hugging Face ↗