GPT
C

commoncatalog-cc-by

קוד פתוח

common-canvascc-by-4.02024-04-22

מאגר ענק של תמונות ברישיון פתוח ברזולוציה שמגיעה עד 4k עם תיאורים סינתטיים באנגלית. הוא נבנה כדי לאפשר אימון מודלי יצירת תמונה ממקור ידוע ומסודר משפטית.

  • 35,290הורדות בחודש
  • 40לייקים

מה זה

המאגר כולל תמונות שנאספו מתוך מאגר Yahoo Flickr Creative Commons המקורי משנת 2014. מדובר בתמונות שהעלו משתמשי פליקר ברזולוציות גבוהות של עד 4k, כשלכל תמונה צורף תיאור טקסטואלי סינתטי שנוצר באמצעות המודל BLIP2. המטרה של המפרסמים היתה לבנות בסיס נתונים פתוח שמאפשר לשחזר מודלים דמויי Stable Diffusion 2 תוך שמירה על מקור נתונים ברור ומעקב אחרי זכויות יוצרים.

המבנה הפנימי מחולק לעשרה תתי-מאגרים שונים שמכילים קובצי Parquet, כאשר כל קובץ שוקל בערך ארבעה גיגהבייט. החלוקה בתוך התיקיות מסודרת לפי טווח רזולוציה של התמונות ויחסי התצוגה שלהן, מה שמקל על שליפת תמונות לפי יחס גובה-רוחב וממדים ספציפיים. בנוסף קיימת חלוקה מובנית בין תמונות שמותרות לשימוש מסחרי לבין תמונות תחת הגבלת שימוש לא מסחרי בלבד.

מתאים ל

  • אימון מחוללי תמונות

    מתאים לאימון מודלי text-to-image ברזולוציה גבוהה ממקור חוקי ומוגדר.

  • אימון מודלי ראייה לשפה

    משמש לאימון מודלי image-to-text על בסיס תיאורים מפורטים באנגלית.

  • מחקר ייחוס נתונים

    בדיקת השפעת נתוני האימון על תוצרי המודל בזכות מקורות ידועים ומסודרים.

איפה זה נופל

התמונות נאספו ב־2014 ממשתמשי פליקר, ולכן יש בהן הטיה מובהקת כלפי מדינות מערביות בעלות חיבור נרחב לאינטרנט. אזורים כמו הדרום הגלובלי סובלים מתת-ייצוג משמעותי במאגר. הטקסטים כולם באנגלית ומבוססים על יצירה סינתטית של BLIP2, מה שאומר שאין כאן תיאורים אנושיים אותנטיים ואין תמיכה בעברית או בשפות אחרות. הנתונים ישנים למדי, ולכן סגנונות מודרניים או נושאים עדכניים מהעשור האחרון פשוט לא קיימים כאן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

הרישיון המוצהר של המאגר הוא cc-by-4.0, שמאפשר עקרונית שימוש מסחרי עם מתן קרדיט. יחד עם זאת, הכרטיס מציין שהנתונים מחולקים פנימית לחלקים מסחריים וחלקים שאינם מסחריים לפי הרישיון המקורי בפליקר. יש לסנן את התיקיות המסחריות בלבד לפני שמאמנים מודל מסחרי.

האם יש במאגר תמיכה בעברית?

לא. כל התיאורים במאגר נוצרו באנגלית באמצעות BLIP2. מי שמעוניין לאמן מודל עם תמיכה בעברית יצטרך לתרגם את התיאורים בעצמו או להוסיף דאטה חיצוני.

מאיפה הגיעו התמונות והטקסטים?

התמונות נלקחו מתוך מאגר YFCC100M של משתמשי יאהו פליקר משנת 2014. התיאורים אינם הטקסטים המקוריים שהעלו המשתמשים, אלא כיתובים סינתטיים שנוצרו במיוחד עבור הפרויקט בעזרת מודל ראייה ממוחשבת.

איך המאגר מאורגן מבחינה טכנית?

המידע מסודר בעשרה חלקים המכילים 5,575 קובצי Parquet שכל אחד מהם שוקל כארבעה גיגהבייט. הקבצים מקוטלגים בתיקיות לפי רזולוציה ויחס תצוגה, מה שמאפשר להוריד רק את הפורמטים שדרושים למודל שלכם.

איך טוענים

המאגר כולל 5,575 קבצים בפורמט Parquet, המחולקים לתיקיות לפי טווח ממדים כמו 1024 עד 2048 ויחסי תצוגה מוגדרים. הגישה פתוחה לחלוטין ואין צורך באישור מיוחד כדי להוריד את הקבצים. קחו בחשבון שכל קובץ שוקל סביב ארבעה גיגהבייט, כך שהורדה מלאה דורשת נפח אחסון משמעותי מאוד וחיבור רשת חזק. כדי לחסוך זמן ומשאבים, מומלץ לסנן מראש את הקבצים הרצויים ישירות מתוך המבנה של יחסי התצוגה והרזולוציה.

from datasets import load_dataset

ds = load_dataset("common-canvas/commoncatalog-cc-by")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה מחדש, בתנאי שניתן קרדיט מתאים ליוצרים המקוריים ומצוין השינוי שנעשה. אין דרישה לשתף תוצרים באותו רישיון, כך שניתן לאמן מודלים לשימוש מסחרי פנימי או פתוח. יחד עם זאת, יש לשים לב שהכרטיס מציין חלוקה פנימית לתמונות מסחריות ולא מסחריות שמקורן בפליקר.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗