GPT
F

fondant-cc-25m

קוד פתוח

fondant-aicc2023-09-15

  • art

המאגר מרכז 25 מיליון קישורים לתמונות עם רישיונות Creative Commons מתוך Common Crawl. הוא מתאים למי שרוצה לאמן מודלי תמונה בלי להסתבך עם הפרת זכויות יוצרים מסחריות.

  • 1,036הורדות בחודש
  • 55לייקים

מה זה

המאגר לא שומר את התמונות עצמן, אלא קישורים ישירים להורדה לצד טקסט חלופי של התמונה וכתובת דף המקור. כל רשומה כוללת גם את סוג רישיון ה־Creative Commons שזוהה, המיקום שבו הוא הופיע בעמוד, וכתובת אתר מנורמלת למיון. אין כאן חלוקה מובנית לסטים של אימון, בדיקה או ולידציה.

היוצרים סרקו עמודי אינטרנט מתוך Common Crawl וסימנו דפים שכללו קישור לרישיון באזורי התחתיות או בסרגלי הצד. רק סביב 0.164 אחוזים מהעמודים שנדגמו עמדו בקריטריון הזה. מתוך הדפים האלה נאספו כל כתובות התמונות, כאשר בדיקה ידנית של מדגם מצאה שגיאת שיוך רישיון בשיעור של 3.68 אחוזים.

מתאים ל

  • אימון מודלי text-to-image

    יצירת בסיס נתונים רחב להזנת מודלי דיפוזיה, תוך סינון מוקדם של רישיונות שלא מתאימים לצרכים.

  • פיין-טיונינג לראייה ממוחשבת

    כיול מודלים קיימים על תמונות רשת מגוונות תוך שימוש בטקסט החלופי כתווית ראשונית.

  • בניית צנרת ניקוי וסינון

    פיתוח רכיבים אוטומטיים להסרת כפילויות, זיהוי טקסט וסינון תוכן פוגעני על גבי נתוני רשת.

איפה זה נופל

ההורדה תלויה בשרתים חיצוניים שחלקם כבר לא זמינים או חוסמים זחלנים, כך שלא תקבלו את כל 25 מיליון התמונות. בנוסף, לא נעשה סינון לתכנים בוטים, אלימים או פוגעניים, והיוצרים מציינים במפורש שסינון פרטים מזהים עדיין בפיתוח. הטקסטים נשענים על תגיות alt מקוריות שלעיתים קרובות אינן מתארות את התמונה, ואין מידע על ייצוג לשפות שאינן אנגלית כמו עברית. הניקוי כלל כפילויות של כתובות בלבד, ללא בדיקת דמיון ויזואלי של התוכן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקטים מסחריים?

זה תלוי בכל תמונה בנפרד. הרשומות כוללות תמונות ברישיונות שונים, כולל כאלה שאוסרים שימוש מסחרי או מחייבים ייחוס, ולכן תצטרכו להשתמש בעמודת הרישיון כדי לסנן רק מה שמתאים להגדרות שלכם.

האם המאגר שומר את קובצי התמונות עצמם?

לא, המאגר מכיל רק קובצי Parquet עם כתובות URL ומטא-דאטה. את התמונות תצטרכו להוריד בעצמכם בעזרת סקריפט פייתון או דרך כלי העיבוד של המפתחים.

האם יש במאגר תיאורים בעברית?

הטקסטים מגיעים ישירות מתגיות ה־alt של אתרים שנסרקו מ־Common Crawl. הרוב המוחלט הוא באנגלית, ואין ערובה להיקף או לאיכות התוכן בעברית.

כמה אמינה ההגדרה של הרישיון בכל תמונה?

בדיקה ידנית של היוצרים מצאה כ־3.68 אחוזי שגיאה בשיוך הרישיונות. השגיאות נובעות מבעיות בניתוח הדפים או מכך שבעלי האתרים הגדירו רישיון שלא כדין.

איך טוענים

הנתונים מחולקים ל־2,503 קובצי Parquet שונים תחת תיקיית data, וטוענים אותם ישירות משם או באמצעות פייפליין של כלי הקוד הפתוח Fondant. כדי להוריד תמונות בפועל צריך להריץ סקריפט פייתון ייעודי שמסופק במאגר, או להרים סביבת Docker מקומית שדורשת לפחות 8GB זיכרון עבודה ומערכת הפעלה עם פייתון 3.8 ומעלה. השדות הקריטיים לתהליך הם כתובת התמונה להורדה, הטקסט החלופי שמשמש כתיאור, וסוג הרישיון לסינון מראש.

from datasets import load_dataset

ds = load_dataset("fondant-ai/fondant-cc-25m")

הרישיון

המאגר מדווח תחת רישוי כללי של Creative Commons, אך כל תמונה שומרת על הרישיון הספציפי שלה שמופיע ברשומה. חלק מהתמונות דורשות ייחוס, וחלקן עשויות לאסור שימוש מסחרי או לדרוש שיתוף זהה. מודל שתאמנו עלול להיות כפוף לתנאים האלה, ולכן חובה לסנן את קובצי המקור לפי סוג הרישיון לפני תחילת האימון.

הרישיון המלא ב־Hugging Face ↗