GPT
C

coyo-700m

קוד פתוח

kakaobraincc-by-4.02022-08-25

  • image-text pairs

המאגר כולל 747 מיליון זוגות של תמונה וטקסט מהרשת עם ציוני איכות מוכנים מראש. הוא מתאים למי שרוצה לאמן מודלי ראייה ושפה בלי לסנן נתונים גולמיים מאפס.

  • 1,890הורדות בחודש
  • 166לייקים

מה זה

הנתונים נאספו מסריקות Common Crawl שנעשו בין אוקטובר 2020 לאוגוסט 2021, מתוך כעשרה מיליארד מופעים מקוריים של תגיות תמונה וטקסט חלופי באנגלית. כל רשומה כוללת מזהה ייחודי, כתובת אינטרנט של התמונה וטקסט התיאור שלה, לצד מידות, גיבוב תפיסתי, ספירת מילים, טוקנים למודלים שונים ומספר פנים שזוהו.

הסינון הראשוני הסיר תמונות קטנות מחמישה קילובייט או ברזולוציה שנמוכה ממאתיים פיקסלים, תמונות ביחס צד קיצוני מעל שלוש, וכפילויות מול מאגרים פופולריים כמו ImageNet או MS-COCO. ברמת הטקסט נשמרו רק משפטים באנגלית שמכילים שמות עצם, סוננו קללות וביטויים שחזרו מעל עשר פעמים, והוסרו מקרים של תוכן למבוגרים לפי שני מודלי סיווג ייעודיים.

הערך המרכזי כאן הוא הציונים המחושבים מראש לכל זוג. המאגר מציג ציוני דמיון לפי שתי גרסאות של CLIP, מדד אסתטיקה של LAION, סבירות לקיום סימן מים והסתברות לתכנים בוטים, מה שמאפשר לחתוך תתי קבוצות לפי איכות בלי לבצע הרצה עצמאית על הכל.

מתאים ל

  • אימון מודלי CLIP

    אימון מודלי התאמה בין טקסט לתמונה מאפס או כוונון עדין על פי ציוני הדמיון שכבר חושבו מראש.

  • יצירת תמונות מטקסט

    סינון זוגות עם ציון אסתטיקה גבוה כדי לאמן מודלי פעפוע ומחוללי תמונות על דאטה ממוקד.

  • אימון מודלי ראייה ממוחשבת

    שימוש ברשומות עם חיתוך לפי שדה מספר הפנים או לפי רזולוציה לטובת משימות סיווג וזיהוי.

איפה זה נופל

אין כאן שום עברית. כל הטקסט סונן לאנגלית בלבד, וכל המידע נשען על מה שהיה זמין ברשת בשנים 2020 ו־2021. מעבר לזה, תהליך הסינון היה אוטומטי לחלוטין וללא בדיקה אנושית, כך שלמרות הפילטרים קיימים בפנים תכנים פוגעניים, לא הולמים או מוטים שהמודלים לא תפסו. היוצרים מצהירים במפורש שלא כדאי להכניס את הנתונים ישירות למוצר מסחרי בלי עיבוד וניקוי ייעודיים.

שאלות
נפוצות

האם המאגר מכיל את קובצי התמונה עצמם?

לא. המאגר מכיל קובצי Parquet עם כתובות אינטרנט של התמונות לצד הטקסט והמדדים המחושבים. כדי להשתמש בהן תצטרכו להוריד את התמונות בעצמכם מתוך הקישורים.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

רישיון המאגר הוא CC-BY-4.0 ואינו מגביל שימוש מסחרי, אך הנתונים עצמם מקושרים מתוך אתרים ברשת וכפופים לתנאי השימוש שלהם. היוצרים מזהירים מפני שימוש ישיר במוצרים מסחריים ללא סינון נוסף של תכנים לא ראויים.

האם יש במאגר נתונים בעברית?

לא. תהליך הסינון של המאגר השתמש בזיהוי שפה ושמר רק טקסטים באנגלית. לא תמצאו בו דוגמאות בעברית או תמיכה בריבוי שפות.

במה הוא שונה ממאגרי ענק אחרים כמו LAION?

הוא כולל כבר בתוך הרשומות מגוון מטה דאטה שחושב מראש, כמו ספירת פנים, אסימוני מודלים, שני ציוני סינון תכנים בוטים וציוני דמיון CLIP. זה חוסך ריצות חישוב יקרות כשרוצים לייצר תת קבוצה מסוננת.

איך טוענים

המאגר מחולק לקובצי Parquet דחוסים בשיטת Snappy ויושב בגישה פתוחה בלי צורך באישור מיוחד. אתם לא מקבלים קובצי תמונה פיזיים אלא קישורים להורדה ברשת, כך שכדי לעבוד איתו תצטרכו להריץ תהליך הורדה מסיבי של התמונות עצמן, להביא בחשבון קישורים שבורים ולשמור על רוחב פס ושטח אחסון גדולים. עמודות הדמיון והסינון הן אלו שכדאי לטעון קודם כדי לסנן רשומות לפני משיכת המדיה בפועל.

from datasets import load_dataset

ds = load_dataset("kakaobrain/coyo-700m")

הרישיון

המאגר עצמו מופץ ברישיון ייחוס CC-BY-4.0, שמתיר שימוש מסחרי, שינוי והפצה, כל עוד אתם נותנים קרדיט ליוצרים. עם זאת, התמונות והטקסטים ברשת כפופים לזכויות היוצרים המקוריות של האתרים שמהם נלקחו, כך שהאחריות המשפטית על אימון מסחרי נשארת אצלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗