GPT
N

newyorker_caption_contest

קוד פתוח

jmhesselcc-by-4.02022-09-29

  • humor
  • caption contest
  • new yorker

המאגר מרכז קריקטורות מתחרויות הניו יורקר לצד כיתובים והסברים. הוא מתאים למי שרוצה לבחון יכולות הומור, הבנה ויזואלית מורכבת והסבר בדיחות במודלים רב מודאליים.

  • 13,789הורדות בחודש
  • 76לייקים

מה זה

הנתונים מבוססים על תחרויות הכיתובים של הניו יורקר וכוללים שילוב של תמונות, הצעות לכיתובים, ישויות, שאלות והסברים כתובים. החומר נאסף ממקורות קהילתיים וממומחים שיצרו הסברים ותיאורים לקריקטורות, כולל סימון הרכיב החריג בתמונה. חלק מהרשומות כוללות תיאורים טקסטואליים מלאים של מה שקורה באיור, וחלק מיועדות לעבודה ישירה מול הפיקסלים.

המבנה מחולק לשלוש משימות עיקריות, שלכל אחת יש גרסאות מבוססות טקסט ותמונה או פיקסלים בלבד, לצד חלוקות שונות להערכה סטטיסטית. משימת ההסבר מתמקדת בניתוח הבדיחה, משימת ההתאמה בוחנת קישור כיתוב לאיור, ומשימת הדירוג עוסקת בזיהוי הכיתוב המנצח בתחרות.

מתאים ל

  • הערכת הבנת הומור ויזואלי

    בדיקת היכולת של מודלים רב מודאליים לזהות מדוע קריקטורה מצחיקה ולבחור את הכיתוב הנכון מתוך כמה אפשרויות.

  • יצירת הסברים לבדיחות

    אימון או בחינה של מודלי שפה על יצירת הסבר מילולי שמפרק את האיגיון או הניגוד באיור.

  • דירוג כיתובים מתחרים

    מדידת ביצועים במשימות בחירה מרובה שבהן המערכת צריכה לזהות את הכיתוב שזכה בתחרות המקורית.

איפה זה נופל

כל הטקסטים במאגר כתובים באנגלית בלבד וספציפיים מאוד לתרבות, לסגנון ולהומור האמריקאי של הניו יורקר, כך שאין כאן שום ייצוג לעברית או להקשר ישראלי. היקף הרשומות מצומצם ועומד על אלפים בודדים של דוגמאות בכל חלוקה, מה שהופך אותו ללא מתאים לאימון מודלים מאפס. בנוסף, הנתונים פורסמו בשנת 2022 ומסתמכים בחלקם על תיוג המונים, מה שעלול להכניס חוסר אחידות באיכות ההסברים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן, הרישיון המדווח הוא cc-by-4.0 שמתיר במפורש שימוש מסחרי. אתם רק נדרשים לתת קרדיט ברור ליוצר המאגר לפי תנאי הרישיון. אין מניעה לשלב מודל שאומן עליו בתוך מוצר.

כמה שוקל הדאטהסט ומה גודל ההורדה?

המאגר כולו מורכב מ־102 קבצים, והמשקל משתנה לפי הקונפיגורציה שאתם בוחרים למשוך. גרסאות ההסבר שוקלות סביב 140 מגה בייט להורדה, בעוד משימות ההתאמה והדירוג מגיעות לכמעט 600 מגה בייט לכל פיצול. אתם לא חייבים להוריד הכל בבת אחת אלא רק את החלק הרלוונטי.

האם יש במאגר תמיכה בשפה העברית?

לא, המאגר מוגדר כמונולינגואלי באנגלית בלבד. כל התיאורים, הכיתובים, השאלות וההסברים נשענים על תרבות אמריקאית ולא תורגמו לעברית. אם תרצו לעבוד בעברית, תצטרכו לתרגם את הטקסטים בעצמכם ולהתאים את ההקשר.

איך נאספו הנתונים שבמאגר?

חומרי הגלם מבוססים על תחרויות הקריקטורות של כתב העת ניו יורקר. הטקסטים וההסברים נוצרו בשילוב של מיקור המונים ועבודה של מומחים, לצד שליפת הנתונים מהתחרויות עצמן. המפרסמים ארגנו את המידע בכמה פורמטים שונים כדי לאפשר בדיקה מול טקסט ומול פיקסלים.

איך טוענים

אתם טוענים את הנתונים ישירות דרך הספרייה הרגילה של Hugging Face בפורמט Parquet, ללא צורך באישור גישה מיוחד. חובה לבחור קונפיגורציה ספציפית בעת הטעינה, כמו explanation או matching, שכן המאגר כולל מעל מאה קבצים בגדלים שנעים בין עשרות מגה בייטים למאות מגה בייטים לכל משימה. השדות המרכזיים שצריך לשים לב אליהם הם התמונה, אפשרויות הכיתובים והתווית הנכונה.

from datasets import load_dataset

ds = load_dataset("jmhessel/newyorker_caption_contest")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי שאתם מעניקים ייחוס הולם ליוצרים המקוריים. אין כאן חובת שיתוף באותו רישיון עבור המודל שאימנתם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗