GPT
S

synthetic-dataset-1m-dalle3-high-quality-captions

קוד פתוח

ProGamerGovmit2024-04-01

  • image
  • text
  • image-text-dataset
  • synthetic-dataset
  • CogVLM

מעל מיליון תמונות שנוצרו בבינה מלאכותית ונבחרו בידי משתמשים, בליווי תיאורים מפורטים שחולצו במודלי ראייה. הוא מיועד למי שמאמן מודלי תמונה או שפה על תוצרים ויזואליים מורכבים.

  • 2,679הורדות בחודש
  • 154לייקים

מה זה

המאגר מכיל תמונות שנוצרו בעיקר ב־DALL-E 3, לצד כמה עשרות אלפים מ־Midjourney ועוד מעט מ־Stable Diffusion. הנתונים נאספו מרחבי הרשת ומשקפים תמונות שאנשים בחרו לשתף בעצמם מאז ספטמבר 2023. רוב הקבצים מגיעים ברזולוציה של 1024x1024 או 1792x1024 בפורמטים JPEG ו־PNG. רשומות כפולות סוננו לפי גיבוב של התמונה, ובוצע סינון ידני ליותר מ־300,000 תמונות כדי להעיף תוכן שנאה, רינדורים שכשלו ותמונות שאינן בינה מלאכותית.

לכל תמונה הוצמד תיאור ארוך ומפורט שנבנה באמצעות CogVLM. התיאור הקצר סוכם ממנו על ידי מודלים כמו Dolphin 2.6 או Llama 3. בנוסף, הרשומות כוללות את ממדי התמונה, נתוני גיבוב שונים, מקור האיסוף ברשת, ולעיתים גם את הפרומפט המקורי ששימש ליצירה או תיאורים חלופיים.

מתאים ל

  • אימון מודלי יצירת תמונה

    שימוש בתיאורים המפורטים כדי לאמן מודלים להפיק תמונות עשירות ומורכבות יותר מתיאורי טקסט.

  • כוונון מודלי ראייה ושפה

    אימון מודלי תמונה לטקסט להפקת תיאורים עמוקים על מושגים מופשטים, סגנונות אמנותיים ויצירות פנטזיה.

  • הערכת ביצועי מודלים

    בדיקת היכולת של מודלים מרובי אופנויות לזהות פרטים זעירים ומבנים חריגים בתמונות סינתטיות.

איפה זה נופל

התמונות נוצרו לפי טעמם האישי של משתמשים שבחרו לשתף אותן, ולכן הן כוללות הטיות אישיות וסגנוניות ואינן מייצגות את כלל היכולות או הדאטה שעליו המודלים אומנו. הטקסטים נכתבו באנגלית בלבד. מודל CogVLM נוטה לפתוח תיאורים בביטויים קבועים וחוזרים, דבר שדורש ניקוי של הטקסט לפני אימון. בנוסף, קישורי המקור שצורפו לחלק מהתמונות כבר אינם פעילים, והפרומפט המקורי חסר בחלק גדול מהמקרים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הדאטהסט משוחרר ברישיון MIT שמאפשר שימוש מסחרי, שינוי והפצה ללא תשלום. נדרש רק לצרף את תנאי הרישיון והקרדיט המקורי.

האם יש במאגר תמיכה בעברית?

לא. כל התיאורים נכתבו וסוכמו באנגלית באמצעות מודלי שפה, והפרומפטים שנשמרו מבוססים על קלט המשתמשים באנגלית. כדי להשתמש בו למודל בעברית יש לתרגם את הנתונים.

איך נאספו התמונות שבמאגר?

היוצרים אספו תמונות פומביות שמשתמשים פרסמו באתרים כמו Reddit בין ספטמבר 2023 לתחילת 2024. לאחר מכן הופעלו אלגוריתמים לסינון כפילויות ובדיקה ידנית לעשרות אלפי תמונות להסרת תוכן פוגעני.

מה ההבדל בין מאגר זה למאגרי תמונות רגילים?

המאגר אינו מכיל צילומים מהעולם האמיתי, אלא תמונות שנוצרו כולן בבינה מלאכותית. התיאורים לא נלקחו מטקסט חלופי פשוט ברשת, אלא הופקו במיוחד בפירוט גבוה על ידי מודל ראייה.

איך טוענים

הנתונים מחולקים לקובצי ארכיון בפורמט WebDataset, כאשר כל קובץ tar מכיל עד 25,000 תמונות או עד משקל של 10 גיגה-בייט. בסך הכל ישנם עשרות קובצי tar במאגר. הגישה חופשית ואינה דורשת אישור, ואפשר לטעון את המידע ישירות בספריית datasets של Hugging Face. מומלץ להשתמש בהזרמה כדי לעבד את הנתונים בלי להוריד את כל הנפח לכונן המקומי. השדות המרכזיים לעבודה הם התמונה עצמה, התיאור הארוך והתיאור הקצר.

from datasets import load_dataset

ds = load_dataset("ProGamerGov/synthetic-dataset-1m-dalle3-high-quality-captions")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי של המידע והפצה מחדש, ואינו מחייב שיתוף של מודלים תחת אותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי. המשמעות היא שניתן לאמן עליו מודלים מסחריים בלי הגבלה מצד מפיצי הדאטהסט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗